お問い合わせ

コース概要

はじめに

ビッグデータの概要

Sparkの基本概観

Pythonの概要

PySparkの概要

  • 耐障害性分散データセットフレームワークを利用したデータ配布方法
  • Spark APIオペレーターを用いた計算処理の分散化手法

Python環境とSparkの連携設定

PySparkの初期設定方法

Amazon Web Services(AWS)EC2インスタンスにおけるSpark利用手順

Databricksのセットアップ

AWS EMRクラスターの構築方法

Pythonプログラミング基礎知識

  • Pythonの基本導入
  • Jupyter Notebookの利用法
  • 変数と単純なデータ型の扱い方
  • リスト操作の基本
  • if文による条件判断手法
  • ユーザー入力情報の処理方法
  • whileループの実装手順
  • 関数定義の方法
  • クラスの作成・活用技術
  • ファイル操作および例外処理手法
  • プロジェクト構成・データ管理およびAPI連携基礎知識

Spark DataFrameの基本習得

  • Spark DataFramesの利用準備
  • 基本的な演算の実行方法
  • グループ化や集計処理の進め方
  • 時刻・日付データの操作手法

Spark DataFrameを用いたプロジェクト演習

MLlibによる機械学習概説

MLlib、Spark、Pythonを活用した機械学習実践法

回帰分析の基礎知識

  • 線形回帰理論の理解
  • 回帰評価コードの作成手順
  • サンプル線形回帰演習への取り組み方
  • ロジスティック回帰理論の概要説明
  • ロジスティック回帰コードの構築法
  • サンプルロジスティック回帰問題の解決手順

ランダムフォレストと決定木理論

  • 樹形モデル手法の基本原理習得
  • 決定木・ランダムフォレスト用コード実装方法
  • サンプル分類問題におけるランダムフォレスト適用手順

K-meansクラスタリングの活用

  • K-means理論内容の把握
  • K-meansアルゴリズム実装手順
  • サンプルクラス分類演習への適用方法

レコメンダーシステム構築法

自然言語処理の基礎導入

  • 自然言語処理技術概観
  • 関連ツール群の紹介
  • サンプルNLP問題への対応手順

Python上でのSparkストリーミング処理

  • Sparkによるストリーム処理概要説明
  • 実際のストリーム処理演習例紹介

まとめ

要求

  • 一般的なプログラミング知識があること

対象者

  • 開発者
  • IT専門職の方々
  • データサイエンティスト
 21 時間

参加者の人数


参加者1人あたりの価格

お客様の声 (6)

今後のコース

関連カテゴリー