お問い合わせ

コース概要

序論、目標、移行戦略

  • コースの目標、参加者プロファイルの整合性、成功基準
  • ハイレベルな移行アプローチとリスクの考慮事項
  • ワークスペース、リポジトリ、ラボデータセットのセットアップ

Day 1 — 移行の基礎とアーキテクチャ

  • Lakehouseの概念、Delta Lakeの概要、Databricksのアーキテクチャ
  • SMPとMPPの違い、および移行への影響
  • メダリオン(Bronze→Silver→Gold)設計とUnity Catalogの概要

Day 1 Lab — ストアドプロシージャの変換

  • サンプルのストアドプロシージャをノートブックへの変換ハンズオン
  • 一時テーブルおよびカーソルをDataFrame変換へのマッピング
  • 元の出力との検証と比較

Day 2 — 高度なDelta Lake & 増分読み込み

  • ACIDトランザクション、コミットログ、バージョニング、タイムトラベル
  • Auto Loader、MERGE INTOパターン、アップサート、スキーマ進化
  • OPTIMIZE、VACUUM、Z-ORDER、パーティショニング、ストレージチューニング

Day 2 Lab — 増分取り込み & 最適化

  • Auto Loaderの取り込みとMERGEワークフローの実装
  • OPTIMIZE、Z-ORDER、VACUUMの適用と結果の検証
  • 読み込み/書き込みパフォーマンスの改善測定

Day 3 — DatabricksにおけるSQL、パフォーマンス & デバッグ

  • 分析用SQL機能:ウィンドウ関数、高次関数、JSON/配列の処理
  • Spark UIの読み取り、DAG、シャッフル、ステージ、タスク、ボトルネックの診断
  • クエリチューニングパターン:ブロードキャスト結合、ヒント、キャッシュ、スプillageの低減

Day 3 Lab — SQLリファクタリング & パフォーマンスチューニング

  • 重量級のSQLプロセスを最適化されたSpark SQLへリファクタリング
  • Spark UIトレースを使用してスキューとシャッフルの問題を特定し修正する
  • 実行前後のベンチマーク測定とチューニング手順の文書化

Day 4 — 実戦的PySpark:手続き型ロジックの代替

  • Spark実行モデル:ドライバー、エグゼキューター、遅延評価、パーティショニング戦略
  • ループとカーソルをベクトル化されたDataFrame操作へ変換
  • モジュール化、UDF/pandas UDF、ウィジェット、再利用可能なライブラリ

Day 4 Lab — 手続き型スクリプトのリファクタリング

  • 手続き型ETLスクリプトをモジュール化されたPySparkノートブックへリファクタリング
  • パラメータ化、ユニットテスト風テスト、再利用可能な関数の導入
  • コードレビューとベストプラクティスチェックリストの適用

Day 5 — オーケストレーション、エンドツーエンドパイプライン & ベストプラクティス

  • Databricks Workflows:ジョブ設計、タスク依存関係、トリガー、エラーハンドリング
  • 品質ルールとスキーマ検証を備えた増分メダリオンパイプラインの設計
  • Git(GitHub/Azure DevOps)、CI、PySparkロジック向けのテスト戦略との統合

Day 5 Lab — 完全なエンドツーエンドパイプラインの構築

  • WorkflowsでオーケストレーションされるBronze→Silver→Goldパイプラインを組み立てる
  • ロギング、監査、リトライ、自動検証の実装
  • パイプライン全体の実行、出力の検証、デプロイメントメモの準備

オペラショナライゼーション、ガバナンス、本番環境準備

  • Unity Catalogのガバナンス、リネージ、アクセス権制御のベストプラクティス
  • コスト、クラスタサイジング、オートスケーリング、ジョブ並行実行パターン
  • デプロイメントチェックリスト、ロールバック戦略、ランブックの作成

最終レビュー、知識移転、次のステップ

  • 移行作業と得られた教訓についての参加者のプレゼンテーション
  • ギャップ分析、推奨されるフォローアップ活動、研修資料の手渡
  • 参考資料、さらなる学習パス、サポートオプション

要求

  • データエンジニアリングの概念の理解
  • SQLおよびストアドプロシージャの経験(Synapse / SQL Server)
  • ETLオーケストレーションの概念の習熟(ADFまたは類似ツール)

対象者

  • データエンジニアリングの背景を持つ技術管理者
  • 手続き型OLAPロジックをLakehouseパターンへ移行するデータエンジニア
  • Databricksの導入を担うプラットフォームエンジニア
 35 時間

参加者の人数


参加者1人あたりの価格

今後のコース

関連カテゴリー