Ta kontakt

Kursplan

Innledning, mål og migrasjonsstrategi

  • Kursmål, tilpasning til deltakerprofil og kriterier for suksess
  • Generelle tilnærminger til migrasjon og risikovurderinger
  • Oppsett av arbeidsflater, repositories og laboratoriedatasett

Dag 1 — Migrasjonsgrunnlegger og arkitektur

  • Lakehouse-konsepter, oversikt over Delta Lake og Databricks-arkitektur
  • Ulike mellom SMP og MPP og implikasjoner for migrasjon
  • Medallion-design (Bronze→Silver→Gold) og oversikt over Unity Catalog

Laboratorium dag 1 — Oversetting av en lagret prosedyre

  • Praktisk migrasjon av en eksemplifisert lagret prosedyre til en notebook
  • Kartlegging av midlertidige tabeller og cursorer til DataFrame-transformasjoner
  • Validering og sammenligning med den originale utdataen

Dag 2 — Avansert Delta Lake & inkrementell lasting

  • ACID-transaksjoner, commit-logg, versjonering og time travel
  • Auto Loader, MERGE INTO-mønstre, upserts og skemas evolusjon
  • OPTIMIZE, VACUUM, Z-ORDER, partisjonering og lagringsjustering

Laboratorium dag 2 — Inkrementell inntak & optimering

  • Implementering av Auto Loader-inntak og MERGE-arbeidsflyter
  • Anvendelse av OPTIMIZE, Z-ORDER og VACUUM; validering av resultater
  • Måling av forbedringer i lese/skriveytelse

Dag 3 — SQL i Databricks, ytelse & feilsøking

  • Analysedrevet SQL-funksjonalitet: vindusfunksjoner, høyere funksjoner, håndtering av JSON/arrayer
  • Lese Spark UI, DAGs, shuffle, stadier, oppgaver og diagnose av flaskehals
  • Mønstre for spørringsjustering: broadcast joins, hints, caching og reduksjon av spill

Laboratorium dag 3 — SQL-omstrukturering & ytelsesjustering

  • Omstrukturere en tung SQL-prosess til optimalisert Spark SQL
  • Bruke Spark UI-spor for å identifisere og rette skjevhet og shuffle-problemer
  • Benchmark før/etter og dokumentere justeringssteg

Dag 4 — Taktisk PySpark: Erstatning av prosedyremessig logikk

  • Sparks eksekusjonsmodell: driver, eksekutorer, lat evaluering og partisjoneringsstrategier
  • Transformasjon av løkker og cursorer til vektoriserte DataFrame-operasjoner
  • Modularisering, UDFs/pandas UDFs, widgets og gjenbrukbare biblioteker

Laboratorium dag 4 — Omstrukturering av prosedyremessige skript

  • Omstrukturere et prosedyremessig ETL-skript til modulære PySpark-notebooks
  • Innføre parametrisering, unit-test-stil og gjenbrukbare funksjoner
  • Kodegjøennomgang og anvendelse av sjekkliste for beste praksis

Dag 5 — Orkestrering, slutt-til-slutt-pipeline & beste praksis

  • Databricks Workflows: jobbdesign, oppgavedependenser, utløsere og feilhåndtering
  • Design av inkrementelle Medallion-pipelines med kvalitetsregler og skemavalidering
  • Integrasjon med Git (GitHub/Azure DevOps), CI og teststrategier for PySpark-logikk

Laboratorium dag 5 — Bygge en komplett slutt-til-slutt-pipeline

  • Sammensette Bronze→Silver→Gold-pipeline orkestrert med Workflows
  • Implementere logging, auditing, gjenntak og automatiske valideringer
  • Kjøre hele pipeline, validere utdata og forberede utleveringsnotater

Operasjonalisering, styring og produksjonsklargjøring

  • Unity Catalog-styring, sledd og tilgangsrekvisisitter – beste praksis
  • Kostnader, klusterstørrelse, autoskalering og mønstre for jobb-konkurrens
  • Utleveringssjekklister, tilbaketaksstrategier og opprettelse av runbooks

Sluttgjennomgang, kunnskapsoverføring og neste steg

  • Deltakernes presentasjon av migrasjonsarbeid og lærte løss
  • Gapanalyse, anbefalte oppfølgingsaktiviteter og utlevering av undervisningsmateriell
  • Referanser, videre læringsstier og støttmuligheter

Krav

  • Forståelse av konsepter innen dataengineering
  • Erfaring med SQL og lagrede prosedyrer (Synapse / SQL Server)
  • Kjennskap til ETL-orkestreringskonsepter (ADF eller lignende)

Målgruppe

  • Teknologiledere med bakgrunn i dataengineering
  • Dataingeniører som migrerer prosedyremessig OLAP-logikk til Lakehouse-mønstre
  • Plattformingeniører ansvarlige for Databricks-vedtak
 35 Timer

Antall deltakere


Pris per deltaker

Kommende kurs

Relaterte kategorier