お問い合わせを送信いただきありがとうございます!当社のスタッフがすぐにご連絡いたします。
予約を送信いただきありがとうございます!当社のスタッフがすぐにご連絡いたします。
コース概要
DatabricksプラットフォームとLakehouseの基礎
- Databricks Lakehouseアーキテクチャとそのコンポーネント
- ワークスペースとカタログの構成
Databricksワークスペースとノートブック
- ワークスペースのナビゲーションおよびノートブックベースの開発
- 再利用可能なノートブックへコード構造化
Apache Sparkアーキテクチャと実行
- Sparkランタイムアーキテクチャおよび実行モデル
- 遅延評価とジョブのDAG(有向非巡回グラフ)
PySpark DataFrameとDataFrame API
- DataFrame抽象化とそのスキーマ
- コアなDataFrame操作および列式
SQLからPySpark DataFrameへの翻訳
- コアなSQL句をDataFrame操作へ翻訳する。
- PySparkでのウィンドウ関数と集計
Databricksにおけるデータの入出力
- 一般的なファイルおよびデータベースソースからの読み取り
- Lakehouse内への書き込みとパーティショニング
Delta Lakeとテーブル管理
- DeltaテーブルおよびACIDトランザクション
- タイムトラベルとスキーマ進化
データクリーニングと変換パターン
- データクリーニングと型変換
- 再利用可能な変換ロジックの構築
ユーザー定義関数とモジュール化されたコード
- Python UDFおよびpandas UDF
- 手続型ロジックを関数へモジュール化する。
パフォーマンスチューニングと最適化
- パーティショニングおよびキャッシュ戦略
- Spark UIによるボトルネックの診断
構造化ストリーミングの基礎
- バッチ処理 versus ストリーミング処理モデル
- ストリーミングDataFrameと基本的な集計
Databricksジョブおよびワークフローオーケストレーション
- ノートブックをジョブやタスクとしてスケジューリングする。
- 依存関係を持つ多段階ワークフローの構築
Unity Catalogとデータガバナンス
- Unity Catalogアーキテクチャおよびネームスペース
- アクセス制御およびデータ系統
テスト、デバッグ、および本番環境でのプラクティス
- PySparkロジックのユニットテスト
- デバッグおよびコード品質基準
金融サービスにおけるエンドツーエンドのユースケース
- 銀行向けETLパイプラインのエンドツーエンド構築
- レガシーなSQLプロセスからPySparkへの移行
SQLワークロードのPySparkへ移行する
- 移行戦略および計画パターン
- SQLワークフローをPySparkへの増分的な変換
要求
- 関数やデータ型を含むPythonプログラミングの経験
- 結合、集計、サブクエリなどを含むSQLの理解
- DatabricksまたはPySparkの先行経験は必須ではありません
受講対象者
- データエンジニア、データアナリスト、およびデータ専門家
- 既存のSQLベースのワークフローをDatabricksとPySparkに移行するチーム
35 時間
お客様の声 (1)
実践的だったことが気に入りました。理論的な知識を実践的な例で適用するのが大好きでした。
Aurelia-Adriana - Allianz Services Romania
コース - Python and Spark for Big Data (PySpark)
機械翻訳