データストリーミングおよびリアルタイムデータ処理のトレーニングコース
コース概要
本コースでは、リアルタイムデータストリーミングシステムの構築に向けた実践的かつ体系的な入門講座を提供します。基本的な概念からアーキテクチャパターン、大規模な連続データ処理に用いられる業界標準ツールまでを取り扱います。受講生は、現代的なフレームワークを用いてストリーミングパイプラインを設計・実装し、最適化する方法を学びます。基礎的な考え方から応用的な活用事例に至るまで段階的に進められるため、実際の本番環境でも活用可能なリアルタイムソリューションを自信を持って構築できるようになります。
研修形式
• 講師による解説付き指導セッション
• 現実世界の事例を用いた概念説明
• 実践的なデモおよびプログラミング演習
• 各日の学習内容に沿った段階的な演習課題
• 双方向型ディスカッションと質疑応答
コース目標
• リアルタイムデータストリーミングの概念およびシステムアーキテクチャを理解する
• バッチ処理とストリーミング処理モデルの違いを把握する
• 拡張性と耐障害性に優れたストリーミングパイプラインを設計する
• 分散型ストリーミングツールやフレームワークを操作できる
• イベント時刻処理、ウィンドウ機能、ステート管理の実装方法を習得する
事業ニーズに合わせたリアルタイムデータソリューションを構築・最適化できるようになる
コース概要
第1日目:講義概要
• データストリーミングの基本概念
• バッチ処理とリアルタイム処理の基礎知識
• イベント駆動型アーキテクチャの基本
• 業界における代表的な利用事例
• ストリーミング技術エコシステムの概要
第2日目
• ストリーミングアーキテクチャ設計パターン
• 分散型メッセージングシステムの基礎知識
• プロデューサーとコンシューマーの役割
• トピック・パーティションおよびデータフロー制御方法
• データ取り込み戦略の設計方針
第3日目
• ストリーム処理の概念と関連フレームワーク
• イベント時刻と処理時刻の差異
• ウィンドウ機能の種類と利用事例
• ステート管理を伴うストリーム処理の実装方法
• 耐障害性確保およびチェックポイント作成手法の基礎知識
第4日目
• ストリーミングパイプライン内でのデータ変換処理
• リアルタイムシステムにおけるETLおよびELT方式の活用
• スキーマ管理と進化方針
• ストリーム結合処理およびデータ拡充手法
• クラウドベースストリーミングサービスの基礎知識
第5日目
• ストリーミングシステムにおけるモニタリングおよび可視化手法
• セキュリティ確保とアクセス制御の基礎知識
• パフォーマンス調整・最適化技術
• エンドツーエンドパイプライン設計に関する総合検討
• 不正検出システムやIoTデータ処理などの実際の事例紹介
オープントレーニングコースには5人以上が必要です。
データストリーミングおよびリアルタイムデータ処理のトレーニングコース - 予約
データストリーミングおよびリアルタイムデータ処理のトレーニングコース - お問い合わせ
データストリーミングおよびリアルタイムデータ処理 - コンサルティングお問い合わせ
お客様の声 (2)
Sparkの世界を旅する:非常に集中型のコース。DSL、Spark SQL、パーティショニングとバケッティングについて。
Georgiana Elisabeta
コース - Apache Spark Fundamentals
機械翻訳
実践的な演習。クラスは本来5日間の予定でしたが、3日間でも多くの疑問を解消できました。
James - BHG Financial
コース - Apache NiFi for Administrators
機械翻訳
今後のコース
関連コース
高度なApache Icebergの活用
21 時間
本講座は、日本にて実施されるインストラクターによるライブトレーニング(オンラインまたは対面)で、高度なスキルを有するデータ専門家を対象としています。参加者はデータ処理ワークフローの最適化やデータ整合性の確保、そして現代のビッグデータアプリケーションの複雑さに対応できる堅牢なデータレイクハウスソリューションの実装を目指します。
本講座終了時には、以下の能力を習得できるようになります:
-
メタデータ管理やファイル構造を含むIcebergのアーキテクチャについて深く理解すること。
-
様々な環境で最適なパフォーマンスが得られるようIcebergを設定し、複数のデータ処理エンジンと統合すること。
-
大規模なIcebergテーブルの管理や複雑なスキーマ変更、パーティション構成の進化に対応すること。
-
大量データセットにおいてクエリパフォーマンスとデータスキャン効率を最適化する技術を習得すること。
-
分散環境下におけるデータ整合性の維持、トランザクション保証の管理、障害対応メカニズムの実装を行うこと。
Apache Icebergの基礎
14 時間本コースは講師によるライブトレーニング(オンラインまたは現地開催)であり、初心者レベルのデータ関連職種の方々を対象としています。受講後には、大規模なデータセットの管理やデータ整合性の確保、処理ワークフローの最適化にApache Icebergを効果的に活用できる知識とスキルが身につきます。
本トレーニング終了時には、以下のことが可能になります:
- Apache Icebergのアーキテクチャや機能、利点をしっかり理解できるようになる
- テーブルフォーマット、パーティショニング、スキーマ進化、タイムトラベル機能について学べる
- さまざまな環境にApache Icebergをインストール・設定できるようになる
- Icebergテーブルの作成、管理、操作が行えるようになる
- 他のテーブルフォーマットからIcebergへのデータ移行手順を理解できるようになる
Google ColabおよびApache Sparkを活用したビッグデータ分析
14 時間本講座は日本にて実施されるインストラクターによるライブ研修(オンラインまたは現地開催)で、Google ColabおよびApache Sparkを用いてビッグデータ処理と分析を行いたい中級レベルのデータサイエンティストやエンジニアを対象としています。
研修終了時には、受講者は以下の能力を身につけることができます:
- Google ColabおよびSparkを用いてビッグデータ環境を構築する
- Apache Sparkを活用して大規模なデータセットを効率的に処理・分析する
- 協働可能な環境でビッグデータの可視化を行う
- Apache Sparkとクラウドベースツールとの連携を実現する
政府機関向けビッグデータ・ビジネスインテリジェンス
35 時間技術の進歩や情報量の増加により、政府を含む多くの業界においてビジネスの在り方が変わりつつあります。モバイル端末やアプリケーション、スマートセンサー、クラウドコンピューティング、市民向けポータルなどが急速に普及する中で、政府機関におけるデータ生成およびデジタル化の速度も上昇しています。情報量が増え、複雑化するにつれて、情報の管理・処理・保存・セキュリティ対策・廃棄処理も同様に複雑化していきます。新たなデータ取得・検索・分析ツールによって、組織は構造化されていないデータからも有益な知見を得られるようになっています。現在の政府市場は大きな転換点にあり、情報こそが戦略的資産であるとの認識が広まっています。そのため、政府機関は構造化・非構造化両方の情報を保護しつつ有効活用することで、より良く市民にサービスを提供し業務目標を達成できるようになっているのです。政府のリーダーたちはデータ主導型組織へと進化させるべく取り組んでおり、各種事象・人材・プロセス・情報間の相互関連性を把握するための基盤づくりも行っています。
今後価値の高い政府向けソリューションは、以下に挙げる最先端技術同士を組み合わせることで実現されると考えられます:
- モバイル端末およびアプリケーション
- クラウドサービス
- ソーシャルビジネステクノロジーおよびネットワーク
- ビッグデータおよびアナリティクス技術
ビッグデータは重要な産業ソリューションのひとつであり、関連性や非関連性を問わず構造化・非構造化データを分析することで得られる傾向を基に意思決定を行うことにより、政府機関がより的確な判断を下せるようになります。
しかし、これらの成果を実現するためには単に膨大なデータ量を蓄積すればよいというだけでは不十分です。「こうした大量のビッグデータから意味を見出すには、多種多様かつ広範囲な情報群の中から有益な知識を抽出できる最先端ツールが必要だ」と、ホワイトハウス科学技術政策局のトム・カリル氏およびフェン・ザオ氏はOSTPブログにて述べています。
2012年に設立された「国家ビッグデータ研究開発イニシアチブ」も、政府機関がこうしたツールを導入できるよう後押しする取り組みの一つです。このプログラムでは、急増するビッグデータおよびその分析に必要な技術環境を活用できるよう2億ドル以上が投じられました。
ビッグデータは大きな可能性を秘める一方で、解決すべき課題も並大抵ではありません。まず重要なのは効率的なデータ保存です。予算的制約が常に存在するため、機関側は単位メガバイトあたりのストレージコストを可能な限り抑えつつ、利用者が必要なときや手段に合わせて容易にアクセスできる体制も維持しなければなりません。膨大なデータ量に対するバックアップ処理も困難さを増しています。
効果的な分析実施もまた大きな課題となっています。多くの機関は商用ツールを用いて莫大な量の情報の中から傾向を導き出し、業務効率化につなげています(MeriTalk社が最近行った調査によれば、連邦政府IT部門の責任者らはビッグデータ活用によって5000億ドル以上のコスト削減と業務目標達成の両立が可能になると考えているとのことです)。
また、独自開発されたビッグデータツールもデータ分析ニーズに応える手段として利用されています。例えばオークリッジ国立研究所の計算データ解析グループは、自社製「Piranha」というアナリティクスシステムを他機関にも提供しており、これにより医療研究者らは大動脈瘤発症を示唆する兆候を見つけ出すことができました。また同システムは履歴書の抽出や求人担当者とのマッチングなど日常業務にも利用されています。
データ分析とビッグデータの実践入門 - 3日間
21 時間日本で開催される本インストラクター主導のライブトレーニングを修了した受講者は、ビッグデータおよびそれに付随する技術・手法・ツールについて実務レベルの理解を得ることができます。
演習を通じて学びを実践する機会があり、グループディスカッションやインストラクターからのフィードバックも重要な要素となります。
講座ではまずビッグデータに関する基本概念の紹介から始め、次にデータ分析用のプログラミング言語と手法へと進みます。最後には、ビッグデータ保存・分散処理・スケーラビリティを支えるツールやインフラについても説明します。
ビッグデータと高度な分析
42 時間ビッグデータと高度な分析とは、大規模かつ複雑なデータセットを解析し、実用的な知見や戦略的な意思決定に役立てるための最先端技術や手法を用いることを指します。
本講座は講師によるライブトレーニングで、オンラインまたは現地での開催となります。予測分析、最適化分析、リアルタイム解析の実現に向けて、ビッグデータ技術や高度な分析方法を活用したい上級レベルのデータ専門家向けです。
講座終了時には、受講者は以下のスキルを習得できるようになります:
- 構造化・非構造化データ向けの大規模データ処理パイプラインの設計と実装
- 膨大なデータに対して高度な機械学習および深層学習手法を適用すること
- 分散コンピューティングフレームワークを用いたリアルタイム解析やデータストリーミングの実現
- ビッグデータ分析技術をビジネスインテリジェンスや意思決定システムへ統合する方法
講座の形式
- 参加型の講義およびディスカッション
- 豊富な演習や実践問題の取り組み
- 実際の環境でのハンズオン演習も行います
カスタマイズオプションについて
- 本講座をご希望に合わせてカスタマイズしたい場合は、お問い合わせいただければ手配いたします。
管理者向け Apache NiFi 入門
21 時間
Apache NiFiは、オープンソースのフローベースデータ統合・イベント処理プラットフォームです。ウェブベースのUIときめ細かな制御機能により、さまざまなシステム間でリアルタイムにデータを自動的にルーティングし、変換したり調整することが可能です。
本講座はインストラクターによる対面またはオンライン形式の実践トレーニングであり、運用環境においてNiFiデータフローを展開・管理・保護・最適化したい中級レベルの管理者およびエンジニアを対象としています。
受講を完了すると、参加者は以下のスキルを習得できます:
- Apache NiFiクラスターのインストール、設定、保守作業
- さまざまなソースおよびターゲット間でのデータフローの設計・管理
- フロー自動化やルーティング、変換のロジック実装
- パフォーマンス最適化、運用状況のモニタリングおよび問題解決
講座形式について
- 実際の事例を踏まえた対話式講義
- フローの構築・展開・管理を行う実習課題
-
実環境を想定したシナリオベースの演習
カスタマイズ可能な内容について
-
本講座のカスタマイズをご希望の場合は、事前にご相談ください。
PySparkと機械学習
21 時間この研修では、PySparkを用いてスケーラブルなデータ処理および機械学習ワークフローを構築するための実践的な入門内容をお伝えします。受講者は、現代のビッグデータエコシステムにおいてApache Sparkがどのように機能し、分散型コンピューティングの原理を用いて大規模なデータセットを効率的に処理するかについて学びます。
Apache Sparkの基礎
21 時間この講座はインストラクターによるライブ研修で日本(オンラインまたは現地開催)であり、非常に大量のデータを処理するためにApache Sparkシステムを導入したいエンジニア向けです。
本研修を修了すると、受講者は以下のことができるようになります:
- Apache Sparkをインストールおよび設定する。
- 非常に大きなデータセットを素早く処理・分析する。
- Apache SparkとHadoop MapReduceの違いや、どちらを使うべきかを理解する。
- 他の機械学習ツールとApache Sparkを連携させる。
Apache Sparkの管理
35 時間日本(オンラインまたは現地開催)で行われるこのインストラクター主導のライブトレーニングは、Sparkクラスターの導入・保守・最適化を目指す初心者から中級レベルのシステム管理者向けです。
講座終了時には受講生は以下のことが可能になります:
- さまざまな環境においてApache Sparkをインストールおよび設定する
- クラスターリソースの管理やSparkアプリケーションの監視を行う
- Sparkクラスターのパフォーマンスを最適化する
- セキュリティ対策を実施し、高可用性を確保する
- 一般的なSpark関連の問題のデバッグおよびトラブルシューティングを行う
クラウド環境におけるApache Spark
21 時間初めてApache Sparkを利用する際は、学習に要する労力がかなり大きく、最初の成果を得るまでには相当な努力が必要です。本コースでは、この難しい第一段階を乗り越えることを目的としています。受講後には、Apache Sparkの基礎知識を習得し、RDDとDataFrameの違いを明確に理解できるようになります。また、PythonおよびScala用APIの使い方や、エグゼキュータやタスクといった概念についても習得します。
加えて、ベストプラクティスに基づき、特にクラウド環境での導入を重視し、DatabricksやAWSに関する知識を深めていただきます。さらに、AWSが提供する最新のSpark関連サービスであるAWS Glueと、従来からあるAWS EMRとの違いについても明確に理解できるようになります。
対象者:
データエンジニア、DevOps担当者、データサイエンティスト
ビッグデータ向けPythonとSpark(PySpark)
21 時間日本にて行われるこの講師主導型実践トレーニングでは、受講者は演習問題を通じてPythonとSparkを用いてビッグデータを分析する方法を学びます。
本トレーニング終了時には、以下のことが可能になります:
- PythonとSparkを活用してビッグデータを効率的に分析する方法を習得する。
- 現実世界のシナリオを想定した演習問題に取り組む。
- PySparkを用いて多様なツールや手法による大規模データ解析を行う。
ビッグデータ処理のためのPython、Spark、Hadoop
21 時間日本にて開催されるこの講師主導型の実践研修は、Spark、Hadoop、Pythonを用いて大規模かつ複雑なデータセットを処理・分析・変換したいと考える開発者向けに設計されています。
受講後には以下のスキルが身につきます:
- Spark、Hadoop、Pythonを用いてビッグデータ処理を開始するための環境設定を行う。
- SparkおよびHadoopの機能・主要コンポーネント・アーキテクチャを理解する。
- ビッグデータ処理においてSpark、Hadoop、Pythonを連携させる方法を習得する。
- Sparkエコシステムに含まれる各種ツール(Spark MlLib、Spark Streaming、Kafka、Sqoop、Flume)の利用法を把握する。
- NetflixやYouTube、Amazon、Spotify、Googleと同様の協調フィルタリング方式のレコメンデーションシステムを構築する。
- Apache Mahoutを活用して機械学習アルゴリズムを大規模化させる。
Stratio:PySparkを活用したRocketモジュールおよびIntelligenceモジュールの実践
14 時間Stratioは、ビッグデータ、人工知能、データガバナンスを一元的に統合するデータ指向型プラットフォームです。そのRocketモジュールとIntelligenceモジュールにより、企業環境において迅速なデータ探索、変換処理および高度な分析が可能となります。
本講座は、Stratio上でPySparkを活用し、RocketおよびIntelligenceモジュールを効果的に利用したい中級レベルのデータ関連従事者向けのインストラクター主導型実習形式のトレーニングです。ループ構造やユーザー定義関数の作成方法、高度なデータ処理ロジックなどを重点的に学びます。
本講座終了時には、受講者は以下のスキルを習得できるようになります:
- Stratioプラットフォーム内でRocketおよびIntelligenceモジュールを用いた作業方法を理解する。
- データ取り込み、変換処理、分析の各フェーズにおいてPySparkを正しく適用できるようになる。
- ループ構造や条件分岐ロジックを用いて、データ処理フローや特徴量生成作業を制御できるようになる。
- PySparkにおける再利用可能なデータ処理を行うためのユーザー定義関数(UDF)の作成・管理手法を習得する。
講座形式について
- インタラクティブな講義およびディスカッション。
- 豊富な演習課題や実践練習の機会が用意されている。
- 実際の環境下で手を動かしながら学ぶライブラボ形式の実習も実施される。
カスタマイズオプションについて
- 本講座内容のカスタマイズ希望の方は、ご要望を伺うためお問い合わせください。