お問い合わせ

コース概要

はじめに

  • SparkおよびHadoopの特徴とアーキテクチャの概要
  • ビッグデータの概念解説
  • Pythonプログラミングの基礎

準備作業

  • Python、Spark、Hadoopのセットアップ方法
  • Pythonにおけるデータ構造の理解
  • PySpark APIの解説
  • HDFSおよびMapReduceの基礎知識

Pythonと連携したSparkおよびHadoopの利用法

  • PythonからSpark RDDを実装する方法
  • MapReduceを用いたデータ処理手法
  • HDFS上に分散型データセットを作成する手順

Spark MLlibによる機械学習の活用

Spark Streamingでのビッグデータ処理

レコメンデーションシステムの構築手法

Kafka、Sqoop、Flumeを活用したデータ処理技術

Apache MahoutとSpark/Hadoopとの連携方法

トラブルシューティング手法

まとめおよび今後の学習方向性

要求

  • SparkおよびHadoopに関する実務経験があること
  • Pythonプログラミングの経験があること

対象者

  • データサイエンティスト
  • 開発者
 21 時間

参加者の人数


参加者1人あたりの価格

お客様の声 (3)

今後のコース

関連カテゴリー