お問い合わせを送信いただきありがとうございます!当社のスタッフがすぐにご連絡いたします。
予約を送信いただきありがとうございます!当社のスタッフがすぐにご連絡いたします。
コース概要
序論、目標、移行戦略
- コースの目標、参加者プロファイルの整合性、成功基準
- ハイレベルな移行アプローチとリスクの考慮事項
- ワークスペース、リポジトリ、ラボデータセットのセットアップ
Day 1 — 移行の基礎とアーキテクチャ
- Lakehouseの概念、Delta Lakeの概要、Databricksのアーキテクチャ
- SMPとMPPの違い、および移行への影響
- メダリオン(Bronze→Silver→Gold)設計とUnity Catalogの概要
Day 1 Lab — ストアドプロシージャの変換
- サンプルのストアドプロシージャをノートブックへの変換ハンズオン
- 一時テーブルおよびカーソルをDataFrame変換へのマッピング
- 元の出力との検証と比較
Day 2 — 高度なDelta Lake & 増分読み込み
- ACIDトランザクション、コミットログ、バージョニング、タイムトラベル
- Auto Loader、MERGE INTOパターン、アップサート、スキーマ進化
- OPTIMIZE、VACUUM、Z-ORDER、パーティショニング、ストレージチューニング
Day 2 Lab — 増分取り込み & 最適化
- Auto Loaderの取り込みとMERGEワークフローの実装
- OPTIMIZE、Z-ORDER、VACUUMの適用と結果の検証
- 読み込み/書き込みパフォーマンスの改善測定
Day 3 — DatabricksにおけるSQL、パフォーマンス & デバッグ
- 分析用SQL機能:ウィンドウ関数、高次関数、JSON/配列の処理
- Spark UIの読み取り、DAG、シャッフル、ステージ、タスク、ボトルネックの診断
- クエリチューニングパターン:ブロードキャスト結合、ヒント、キャッシュ、スプillageの低減
Day 3 Lab — SQLリファクタリング & パフォーマンスチューニング
- 重量級のSQLプロセスを最適化されたSpark SQLへリファクタリング
- Spark UIトレースを使用してスキューとシャッフルの問題を特定し修正する
- 実行前後のベンチマーク測定とチューニング手順の文書化
Day 4 — 実戦的PySpark:手続き型ロジックの代替
- Spark実行モデル:ドライバー、エグゼキューター、遅延評価、パーティショニング戦略
- ループとカーソルをベクトル化されたDataFrame操作へ変換
- モジュール化、UDF/pandas UDF、ウィジェット、再利用可能なライブラリ
Day 4 Lab — 手続き型スクリプトのリファクタリング
- 手続き型ETLスクリプトをモジュール化されたPySparkノートブックへリファクタリング
- パラメータ化、ユニットテスト風テスト、再利用可能な関数の導入
- コードレビューとベストプラクティスチェックリストの適用
Day 5 — オーケストレーション、エンドツーエンドパイプライン & ベストプラクティス
- Databricks Workflows:ジョブ設計、タスク依存関係、トリガー、エラーハンドリング
- 品質ルールとスキーマ検証を備えた増分メダリオンパイプラインの設計
- Git(GitHub/Azure DevOps)、CI、PySparkロジック向けのテスト戦略との統合
Day 5 Lab — 完全なエンドツーエンドパイプラインの構築
- WorkflowsでオーケストレーションされるBronze→Silver→Goldパイプラインを組み立てる
- ロギング、監査、リトライ、自動検証の実装
- パイプライン全体の実行、出力の検証、デプロイメントメモの準備
オペラショナライゼーション、ガバナンス、本番環境準備
- Unity Catalogのガバナンス、リネージ、アクセス権制御のベストプラクティス
- コスト、クラスタサイジング、オートスケーリング、ジョブ並行実行パターン
- デプロイメントチェックリスト、ロールバック戦略、ランブックの作成
最終レビュー、知識移転、次のステップ
- 移行作業と得られた教訓についての参加者のプレゼンテーション
- ギャップ分析、推奨されるフォローアップ活動、研修資料の手渡
- 参考資料、さらなる学習パス、サポートオプション
要求
- データエンジニアリングの概念の理解
- SQLおよびストアドプロシージャの経験(Synapse / SQL Server)
- ETLオーケストレーションの概念の習熟(ADFまたは類似ツール)
対象者
- データエンジニアリングの背景を持つ技術管理者
- 手続き型OLAPロジックをLakehouseパターンへ移行するデータエンジニア
- Databricksの導入を担うプラットフォームエンジニア
35 時間