Contattataci

Struttura del corso

Introduzione, Obiettivi e Strategia di Migrazione

  • Obiettivi del corso, allineamento del profilo dei partecipanti e criteri di successo
  • Approcci di migrazione ad alto livello e considerazioni sui rischi
  • Impostazione di workspace, repository e set di dati per i lab

Giorno 1 — Fondamenti della Migrazione e Architettura

  • Concetti del Lakehouse, panoramica di Delta Lake e architettura Databricks
  • Differenze tra SMP e MPP e implicazioni per la migrazione
  • Progettazione Medallion (Bronze→Silver→Gold) e panoramica di Unity Catalog

Lab del Giorno 1 — Traduzione di una Procedura Memorizzata

  • Migrazione pratica di una procedura memorizzata di esempio in un notebook
  • Mappatura di tabelle temporanee e cursori in trasformazioni DataFrame
  • Validazione e confronto con l'output originale

Giorno 2 — Delta Lake Avanzato e Caricamento Incrementale

  • Transazioni ACID, log di commit, versioning e time travel
  • Auto Loader, pattern MERGE INTO, upsert ed evoluzione dello schema
  • OPTIMIZE, VACUUM, Z-ORDER, partizionamento e tuning dello storage

Lab del Giorno 2 — Ingestione e Ottimizzazione Incrementale

  • Implementazione dell'ingestione con Auto Loader e dei workflow MERGE
  • Applicazione di OPTIMIZE, Z-ORDER e VACUUM; validazione dei risultati
  • Misurazione dei miglioramenti delle prestazioni di lettura/scrittura

Giorno 3 — SQL in Databricks, Prestazioni e Debug

  • Funzionalità SQL analitiche: funzioni di finestra, funzioni di ordine superiore, gestione JSON/array
  • Letto dello Spark UI, DAG, shuffles, stage, task e diagnosi dei colli di bottiglia
  • Pattern di tuning delle query: broadcast joins, hint, caching e riduzione dello spill

Lab del Giorno 3 — Refactoring SQL e Tuning delle Prestazioni

  • Refactor di un processo SQL complesso in Spark SQL ottimizzato
  • Utilizzo delle tracce Spark UI per identificare e correggere problemi di skew e shuffle
  • Benchmarking prima/dopo e documentazione dei passaggi di tuning

Giorno 4 — PySpark Tattico: Sostituzione della Logica Procedurale

  • Modello di esecuzione Spark: driver, executor, valutazione pigra e strategie di partizionamento
  • Trasformazione di loop e cursori in operazioni DataFrame vettorializzate
  • Modularizzazione, UDF/UDF pandas, widget e librerie riutilizzabili

Lab del Giorno 4 — Refactoring di Script Procedurali

  • Refactor di uno script ETL procedurale in notebook PySpark modulari
  • Introduzione alla parametrizzazione, test di tipo unitario e funzioni riutilizzabili
  • Revisione del codice e applicazione di una checklist delle migliori pratiche

Giorno 5 — Orchestrazione, Pipeline End-to-End e Migliori Pratiche

  • Databricks Workflows: design dei job, dipendenze dei task, trigger e gestione degli errori
  • Progettazione di pipeline Medallion incrementalmente con regole di qualità e validazione dello schema
  • Integrazione con Git (GitHub/Azure DevOps), CI e strategie di test per la logica PySpark

Lab del Giorno 5 — Costruzione di una Pipeline End-to-End Completa

  • Assemblaggio della pipeline Bronze→Silver→Gold orchestrata con Workflows
  • Implementazione di log, audit, retry e validazioni automatizzate
  • Esecuzione della pipeline completa, validazione degli output e preparazione delle note di deployment

Operazionalizzazione, Governance e Prontezza per la Produzione

  • Migliori pratiche di governance Unity Catalog, lineage e controllo degli accessi
  • Costi, dimensionamento dei cluster, autoscaling e pattern di concorrenza dei job
  • Checklist di deployment, strategie di rollback e creazione di runbook

Revisione Finale, Trasferimento delle Conoscenze e Prossimi Passi

  • Presentazioni dei partecipanti sul lavoro di migrazione e lezioni apprese
  • Analisi dei gap, attività di follow-up consigliate e consegna dei materiali di formazione
  • Riferimenti, percorsi di apprendimento aggiuntivi e opzioni di supporto

Requisiti

  • Comprensione dei concetti di data engineering
  • Esperienza con SQL e procedure memorizzate (Synapse / SQL Server)
  • Familiarità con i concetti di orchestrazione ETL (ADF o simili)

Pubblico Obiettivo

  • Manager tecnici con un background in data engineering
  • Data engineer che stanno migrando la logica procedurale OLAP verso pattern Lakehouse
  • Ingegneri di piattaforma responsabili dell'adozione di Databricks
 35 ore

Numero di Partecipanti


Prezzo per partecipante

Corsi in Arrivo

Categorie relative