Struttura del corso
Introduzione, Obiettivi e Strategia di Migrazione
- Obiettivi del corso, allineamento del profilo dei partecipanti e criteri di successo
- Approcci di migrazione ad alto livello e considerazioni sui rischi
- Impostazione di workspace, repository e set di dati per i lab
Giorno 1 — Fondamenti della Migrazione e Architettura
- Concetti del Lakehouse, panoramica di Delta Lake e architettura Databricks
- Differenze tra SMP e MPP e implicazioni per la migrazione
- Progettazione Medallion (Bronze→Silver→Gold) e panoramica di Unity Catalog
Lab del Giorno 1 — Traduzione di una Procedura Memorizzata
- Migrazione pratica di una procedura memorizzata di esempio in un notebook
- Mappatura di tabelle temporanee e cursori in trasformazioni DataFrame
- Validazione e confronto con l'output originale
Giorno 2 — Delta Lake Avanzato e Caricamento Incrementale
- Transazioni ACID, log di commit, versioning e time travel
- Auto Loader, pattern MERGE INTO, upsert ed evoluzione dello schema
- OPTIMIZE, VACUUM, Z-ORDER, partizionamento e tuning dello storage
Lab del Giorno 2 — Ingestione e Ottimizzazione Incrementale
- Implementazione dell'ingestione con Auto Loader e dei workflow MERGE
- Applicazione di OPTIMIZE, Z-ORDER e VACUUM; validazione dei risultati
- Misurazione dei miglioramenti delle prestazioni di lettura/scrittura
Giorno 3 — SQL in Databricks, Prestazioni e Debug
- Funzionalità SQL analitiche: funzioni di finestra, funzioni di ordine superiore, gestione JSON/array
- Letto dello Spark UI, DAG, shuffles, stage, task e diagnosi dei colli di bottiglia
- Pattern di tuning delle query: broadcast joins, hint, caching e riduzione dello spill
Lab del Giorno 3 — Refactoring SQL e Tuning delle Prestazioni
- Refactor di un processo SQL complesso in Spark SQL ottimizzato
- Utilizzo delle tracce Spark UI per identificare e correggere problemi di skew e shuffle
- Benchmarking prima/dopo e documentazione dei passaggi di tuning
Giorno 4 — PySpark Tattico: Sostituzione della Logica Procedurale
- Modello di esecuzione Spark: driver, executor, valutazione pigra e strategie di partizionamento
- Trasformazione di loop e cursori in operazioni DataFrame vettorializzate
- Modularizzazione, UDF/UDF pandas, widget e librerie riutilizzabili
Lab del Giorno 4 — Refactoring di Script Procedurali
- Refactor di uno script ETL procedurale in notebook PySpark modulari
- Introduzione alla parametrizzazione, test di tipo unitario e funzioni riutilizzabili
- Revisione del codice e applicazione di una checklist delle migliori pratiche
Giorno 5 — Orchestrazione, Pipeline End-to-End e Migliori Pratiche
- Databricks Workflows: design dei job, dipendenze dei task, trigger e gestione degli errori
- Progettazione di pipeline Medallion incrementalmente con regole di qualità e validazione dello schema
- Integrazione con Git (GitHub/Azure DevOps), CI e strategie di test per la logica PySpark
Lab del Giorno 5 — Costruzione di una Pipeline End-to-End Completa
- Assemblaggio della pipeline Bronze→Silver→Gold orchestrata con Workflows
- Implementazione di log, audit, retry e validazioni automatizzate
- Esecuzione della pipeline completa, validazione degli output e preparazione delle note di deployment
Operazionalizzazione, Governance e Prontezza per la Produzione
- Migliori pratiche di governance Unity Catalog, lineage e controllo degli accessi
- Costi, dimensionamento dei cluster, autoscaling e pattern di concorrenza dei job
- Checklist di deployment, strategie di rollback e creazione di runbook
Revisione Finale, Trasferimento delle Conoscenze e Prossimi Passi
- Presentazioni dei partecipanti sul lavoro di migrazione e lezioni apprese
- Analisi dei gap, attività di follow-up consigliate e consegna dei materiali di formazione
- Riferimenti, percorsi di apprendimento aggiuntivi e opzioni di supporto
Requisiti
- Comprensione dei concetti di data engineering
- Esperienza con SQL e procedure memorizzate (Synapse / SQL Server)
- Familiarità con i concetti di orchestrazione ETL (ADF o simili)
Pubblico Obiettivo
- Manager tecnici con un background in data engineering
- Data engineer che stanno migrando la logica procedurale OLAP verso pattern Lakehouse
- Ingegneri di piattaforma responsabili dell'adozione di Databricks