お問い合わせ

コース概要

導入、目的、および移行戦略

  • コース目標、参加者プロファイルの適合性、成功基準
  • ハイレベルの移行アプローチとリスクの考慮事項
  • ワークスペース、リポジトリ、ラボデータセットのセットアップ

1日目 — 移行の基礎とアーキテクチャ

  • Lakehouseの概念、Delta Lakeの概要、Databricksアーキテクチャ
  • SMPとMPPの違いおよび移行への影響
  • メダリオン(ブロンズ→シルバー→ゴールド)の設計とUnity Catalogの概要

1日目 ラボ — ストアドプロシージャの変換

  • サンプルストアドプロシージャをノートブックへ移行するハンズオン演習
  • 一時テーブルおよびカーソルをDataFrame変換にマッピングする
  • 元の出力との検証と比較

2日目 — 高度なDelta Lake & 増分読み込み

  • ACIDトランザクション、コミットログ、バージョン管理、タイムトラベル
  • Auto Loader、MERGE INTOパターン、アップサート、スキーマのエボリューション
  • OPTIMIZE、VACUUM、Z-ORDER、パーティショニング、ストレージチューニング

2日目 ラボ — 増分取り込み & 最適化

  • Auto Loaderによる取り込みおよびMERGEワークフローの実装
  • OPTIMIZE、Z-ORDER、VACUUMの適用および結果の検証
  • 読み書きパフォーマンスの向上を測定する

3日目 — DatabricksにおけるSQL、パフォーマンス & デバッグ

  • 分析用SQL機能: ウィンドウ関数、高階関数、JSON/配列の処理
  • Spark UIの読み方、DAG、シャッフル、ステージ、タスク、ボトルネックの診断
  • クエリチューニングパターン: ブロードキャストジョイン、ヒント、キャッシュ、スピルの削減

3日目 ラボ — SQLリファクタリング & パフォーマンスチューニング

  • 負荷の高いSQLプロセスを最適化されたSpark SQLへリファクタリングする
  • Spark UIトレースを使用してスカラーおよびシャッフルの問題を特定し修正する
  • 前後のベンチマークを行い、チューニング手順を文書化する

4日目 — 戦術的PySpark: 手続き型ロジックの置き換え

  • Spark実行モデル: ドライバー、エグゼキュータ、遅延評価、パーティショニング戦略
  • ループおよびカーソルをベクトル化されたDataFrame操作に変換する
  • モジュール化、UDF/pandas UDF、ウィジェット、再利用可能なライブラリ

4日目 ラボ — 手続き型スクリプトのリファクタリング

  • 手続き型ETLスクリプトをモジュール化されたPySparkノートブックへリファクタリングする
  • パラメータ化、ユニットテスト風テスト、再利用可能な関数の導入
  • コードレビューおよびベストプラクティスチェックリストの適用

5日目 — オーケストレーション、エンドツーエンドパイプライン & ベストプラクティス

  • Databricks Workflows: ジョブ設計、タスク依存関係、トリガー、エラー処理
  • 品質ルールおよびスキーマ検証を持つ増分メダリオンパイプラインの設計
  • PySparkロジックに関するGit (GitHub/Azure DevOps)、CI、テスト戦略との統合

5日目 ラボ — 完全なエンドツーエンドパイプラインの構築

  • Workflowsによってオーケストレーションされたブロンズ→シルバー→ゴールドパイプラインを組み立てる
  • ログ出力、監査、リトライ、自動検証の実装
  • フルパイプラインの実行、出力の検証、デプロイメントメモの準備

運用化、ガバナンス、本番環境への準備

  • Unity Catalogのガバナンス、系譜、アクセス制御のベストプラクティス
  • コスト、クラスタサイズ設定、オートスケーリング、ジョブ並行性のパターン
  • デプロイメントチェックリスト、ロールバック戦略、ランブックの作成

最終レビュー、ナレッジトランスファー、次のステップ

  • 参加者による移行作業および学びの発表
  • ギャップ分析、推奨されるフォローアップ活動、トレーニング資料の引き継ぎ
  • 参考資料、さらなる学習パス、サポートオプション

要求

  • データエンジニアリングの概念の理解
  • SQLおよびストアドプロシージャの経験 (Synapse / SQL Server)
  • ETLオーケストレーションの概念に精通していること (ADF または同等のもの)

対象者

  • データエンジニアリングのバックグラウンドを持つ技術管理者
  • 手続き型OLAPロジックをLakehouseパターンへ移行するデータエンジニア
  • Databricksの採用を責任を持つプラットフォームエンジニア
 35 時間

参加者の人数


参加者1人あたりの価格

今後のコース

関連カテゴリー