Kontakt aufnehmen

Schulungsübersicht

Databricks-Plattform und Lakehouse-Grundlagen

  • Lakehouse-Architektur und Komponenten von Databricks
  • Organisation von Arbeitsbereichen und Katalogen

Databricks-Arbeitsbereich und Notebooks

  • Navigation im Arbeitsbereich und notebookbasierte Entwicklung
  • Strukturierung von Code in wiederverwendbare Notebooks

Apache Spark-Architektur und Ausführung

  • Ausführungsarchitektur und Ausführungsmodell der Spark-Laufzeitumgebung
  • Lazy Evaluation und der Job-DAG

PySpark DataFrames und die DataFrame-API

  • DataFrame-Abstraktionen und Schemas
  • Kernoperationen von DataFrames und Spaltenausdrücke

Übersetzen von SQL in PySpark DataFrames

  • Übersetzung von SQL-Hauptklauseln in DataFrame-Operationen
  • Fensterfunktionen und Aggregationen in PySpark

Lesen und Schreiben von Daten in Databricks

  • Lesezugriff auf gängige Datei- und Datenbankquellen
  • Schreiben und Partitionieren von Daten im Lakehouse

Delta Lake und Tabellenverwaltung

  • Delta-Tabellen und ACID-Transaktionen
  • Time Travel und Schema-Evolution

Muster für Datenbereinigung und -transformation

  • Datenbereinigung und Typumwandlung
  • Aufbau wiederverwendbarer Transformationslogik

Benutzerdefinierte Funktionen (UDFs) und modulärer Code

  • Python-UDFs und Pandas-UDFs
  • Modularisierung von prozeduraler Logik in Funktionen

Performance-Tuning und Optimierung

  • Strategien für Partitionierung und Caching
  • Diagnose von Engpässen mit der Spark-Benutzeroberfläche

Grundlagen des Structured Streaming

  • Batch-Verarbeitung im Vergleich zu Streaming-Verarbeitungsmodellen
  • Streaming DataFrames und grundlegende Aggregationen

Databricks-Jobs und Workflow-Orchestrierung

  • Planung von Notebooks als Jobs und Aufgaben
  • Aufbau mehrstufiger Workflows mit Abhängigkeiten

Unity Catalog und Data Governance

  • Architektur und Namensräume von Unity Catalog
  • Zugriffskontrolle und Datenlinie (Data Lineage)

Testing, Debugging und Produktionspraktiken

  • Unit-Testing der PySpark-Logik
  • Debugging und Codequalitätstandards

End-to-End-Use Cases im Finanzsektor

  • Aufbau einer End-to-End-Banking-ETL-Pipeline
  • Übersetzung von Legacy-SQL-Prozessen in PySpark

Migrieren von SQL-Workloads zu PySpark

  • Migrationsstrategie und Planungsmuster
  • Inkrementelle Konvertierung von SQL-Workflows zu PySpark

Voraussetzungen

  • Erfahrung mit der Python-Programmierung, einschließlich Funktionen und Datentypen
  • Verständnis von SQL, einschließlich Joins, Aggregationen und Unterabfragen
  • Keine Vorkenntnisse mit Databricks oder PySpark erforderlich

Zielgruppe

  • Data Engineers, Data Analysts und Datenprofis
  • Teams, die bestehende SQL-basierte Workflows auf Databricks und PySpark migrieren
 35 Stunden

Teilnehmerzahl


Preis je Teilnehmer (exkl. USt)

Erfahrungsberichte (1)

Kommende Kurse

Verwandte Kategorien