お問い合わせ

コース概要

DatabricksプラットフォームとLakehouseの基礎

  • Databricks Lakehouseアーキテクチャとそのコンポーネント
  • ワークスペースとカタログの構成

Databricksワークスペースとノートブック

  • ワークスペースのナビゲーションおよびノートブックベースの開発
  • 再利用可能なノートブックへコード構造化

Apache Sparkアーキテクチャと実行

  • Sparkランタイムアーキテクチャおよび実行モデル
  • 遅延評価とジョブのDAG(有向非巡回グラフ)

PySpark DataFrameとDataFrame API

  • DataFrame抽象化とそのスキーマ
  • コアなDataFrame操作および列式

SQLからPySpark DataFrameへの翻訳

  • コアなSQL句をDataFrame操作へ翻訳する。
  • PySparkでのウィンドウ関数と集計

Databricksにおけるデータの入出力

  • 一般的なファイルおよびデータベースソースからの読み取り
  • Lakehouse内への書き込みとパーティショニング

Delta Lakeとテーブル管理

  • DeltaテーブルおよびACIDトランザクション
  • タイムトラベルとスキーマ進化

データクリーニングと変換パターン

  • データクリーニングと型変換
  • 再利用可能な変換ロジックの構築

ユーザー定義関数とモジュール化されたコード

  • Python UDFおよびpandas UDF
  • 手続型ロジックを関数へモジュール化する。

パフォーマンスチューニングと最適化

  • パーティショニングおよびキャッシュ戦略
  • Spark UIによるボトルネックの診断

構造化ストリーミングの基礎

  • バッチ処理 versus ストリーミング処理モデル
  • ストリーミングDataFrameと基本的な集計

Databricksジョブおよびワークフローオーケストレーション

  • ノートブックをジョブやタスクとしてスケジューリングする。
  • 依存関係を持つ多段階ワークフローの構築

Unity Catalogとデータガバナンス

  • Unity Catalogアーキテクチャおよびネームスペース
  • アクセス制御およびデータ系統

テスト、デバッグ、および本番環境でのプラクティス

  • PySparkロジックのユニットテスト
  • デバッグおよびコード品質基準

金融サービスにおけるエンドツーエンドのユースケース

  • 銀行向けETLパイプラインのエンドツーエンド構築
  • レガシーなSQLプロセスからPySparkへの移行

SQLワークロードのPySparkへ移行する

  • 移行戦略および計画パターン
  • SQLワークフローをPySparkへの増分的な変換

要求

  • 関数やデータ型を含むPythonプログラミングの経験
  • 結合、集計、サブクエリなどを含むSQLの理解
  • DatabricksまたはPySparkの先行経験は必須ではありません

受講対象者

  • データエンジニア、データアナリスト、およびデータ専門家
  • 既存のSQLベースのワークフローをDatabricksとPySparkに移行するチーム
 35 時間

参加者の人数


参加者1人あたりの価格

お客様の声 (1)

今後のコース

関連カテゴリー