Takk for at du sendte din henvendelse! En av våre teammedlemmer vil kontakte deg straks.
Takk for at du sendte din bestilling! En av våre teammedlemmer vil kontakte deg straks.
Kursplan
Innledning, mål og migrasjonsstrategi
- Kursmål, tilpasning til deltakerprofil og kriterier for suksess
- Generelle tilnærminger til migrasjon og risikovurderinger
- Oppsett av arbeidsflater, repositories og laboratoriedatasett
Dag 1 — Migrasjonsgrunnlegger og arkitektur
- Lakehouse-konsepter, oversikt over Delta Lake og Databricks-arkitektur
- Ulike mellom SMP og MPP og implikasjoner for migrasjon
- Medallion-design (Bronze→Silver→Gold) og oversikt over Unity Catalog
Laboratorium dag 1 — Oversetting av en lagret prosedyre
- Praktisk migrasjon av en eksemplifisert lagret prosedyre til en notebook
- Kartlegging av midlertidige tabeller og cursorer til DataFrame-transformasjoner
- Validering og sammenligning med den originale utdataen
Dag 2 — Avansert Delta Lake & inkrementell lasting
- ACID-transaksjoner, commit-logg, versjonering og time travel
- Auto Loader, MERGE INTO-mønstre, upserts og skemas evolusjon
- OPTIMIZE, VACUUM, Z-ORDER, partisjonering og lagringsjustering
Laboratorium dag 2 — Inkrementell inntak & optimering
- Implementering av Auto Loader-inntak og MERGE-arbeidsflyter
- Anvendelse av OPTIMIZE, Z-ORDER og VACUUM; validering av resultater
- Måling av forbedringer i lese/skriveytelse
Dag 3 — SQL i Databricks, ytelse & feilsøking
- Analysedrevet SQL-funksjonalitet: vindusfunksjoner, høyere funksjoner, håndtering av JSON/arrayer
- Lese Spark UI, DAGs, shuffle, stadier, oppgaver og diagnose av flaskehals
- Mønstre for spørringsjustering: broadcast joins, hints, caching og reduksjon av spill
Laboratorium dag 3 — SQL-omstrukturering & ytelsesjustering
- Omstrukturere en tung SQL-prosess til optimalisert Spark SQL
- Bruke Spark UI-spor for å identifisere og rette skjevhet og shuffle-problemer
- Benchmark før/etter og dokumentere justeringssteg
Dag 4 — Taktisk PySpark: Erstatning av prosedyremessig logikk
- Sparks eksekusjonsmodell: driver, eksekutorer, lat evaluering og partisjoneringsstrategier
- Transformasjon av løkker og cursorer til vektoriserte DataFrame-operasjoner
- Modularisering, UDFs/pandas UDFs, widgets og gjenbrukbare biblioteker
Laboratorium dag 4 — Omstrukturering av prosedyremessige skript
- Omstrukturere et prosedyremessig ETL-skript til modulære PySpark-notebooks
- Innføre parametrisering, unit-test-stil og gjenbrukbare funksjoner
- Kodegjøennomgang og anvendelse av sjekkliste for beste praksis
Dag 5 — Orkestrering, slutt-til-slutt-pipeline & beste praksis
- Databricks Workflows: jobbdesign, oppgavedependenser, utløsere og feilhåndtering
- Design av inkrementelle Medallion-pipelines med kvalitetsregler og skemavalidering
- Integrasjon med Git (GitHub/Azure DevOps), CI og teststrategier for PySpark-logikk
Laboratorium dag 5 — Bygge en komplett slutt-til-slutt-pipeline
- Sammensette Bronze→Silver→Gold-pipeline orkestrert med Workflows
- Implementere logging, auditing, gjenntak og automatiske valideringer
- Kjøre hele pipeline, validere utdata og forberede utleveringsnotater
Operasjonalisering, styring og produksjonsklargjøring
- Unity Catalog-styring, sledd og tilgangsrekvisisitter – beste praksis
- Kostnader, klusterstørrelse, autoskalering og mønstre for jobb-konkurrens
- Utleveringssjekklister, tilbaketaksstrategier og opprettelse av runbooks
Sluttgjennomgang, kunnskapsoverføring og neste steg
- Deltakernes presentasjon av migrasjonsarbeid og lærte løss
- Gapanalyse, anbefalte oppfølgingsaktiviteter og utlevering av undervisningsmateriell
- Referanser, videre læringsstier og støttmuligheter
Krav
- Forståelse av konsepter innen dataengineering
- Erfaring med SQL og lagrede prosedyrer (Synapse / SQL Server)
- Kjennskap til ETL-orkestreringskonsepter (ADF eller lignende)
Målgruppe
- Teknologiledere med bakgrunn i dataengineering
- Dataingeniører som migrerer prosedyremessig OLAP-logikk til Lakehouse-mønstre
- Plattformingeniører ansvarlige for Databricks-vedtak
35 Timer