Schulungsübersicht
Databricks-Plattform und Lakehouse-Grundlagen
- Lakehouse-Architektur und Komponenten von Databricks
- Organisation von Arbeitsbereichen und Katalogen
Databricks-Arbeitsbereich und Notebooks
- Navigation im Arbeitsbereich und notebookbasierte Entwicklung
- Strukturierung von Code in wiederverwendbare Notebooks
Apache Spark-Architektur und Ausführung
- Ausführungsarchitektur und Ausführungsmodell der Spark-Laufzeitumgebung
- Lazy Evaluation und der Job-DAG
PySpark DataFrames und die DataFrame-API
- DataFrame-Abstraktionen und Schemas
- Kernoperationen von DataFrames und Spaltenausdrücke
Übersetzen von SQL in PySpark DataFrames
- Übersetzung von SQL-Hauptklauseln in DataFrame-Operationen
- Fensterfunktionen und Aggregationen in PySpark
Lesen und Schreiben von Daten in Databricks
- Lesezugriff auf gängige Datei- und Datenbankquellen
- Schreiben und Partitionieren von Daten im Lakehouse
Delta Lake und Tabellenverwaltung
- Delta-Tabellen und ACID-Transaktionen
- Time Travel und Schema-Evolution
Muster für Datenbereinigung und -transformation
- Datenbereinigung und Typumwandlung
- Aufbau wiederverwendbarer Transformationslogik
Benutzerdefinierte Funktionen (UDFs) und modulärer Code
- Python-UDFs und Pandas-UDFs
- Modularisierung von prozeduraler Logik in Funktionen
Performance-Tuning und Optimierung
- Strategien für Partitionierung und Caching
- Diagnose von Engpässen mit der Spark-Benutzeroberfläche
Grundlagen des Structured Streaming
- Batch-Verarbeitung im Vergleich zu Streaming-Verarbeitungsmodellen
- Streaming DataFrames und grundlegende Aggregationen
Databricks-Jobs und Workflow-Orchestrierung
- Planung von Notebooks als Jobs und Aufgaben
- Aufbau mehrstufiger Workflows mit Abhängigkeiten
Unity Catalog und Data Governance
- Architektur und Namensräume von Unity Catalog
- Zugriffskontrolle und Datenlinie (Data Lineage)
Testing, Debugging und Produktionspraktiken
- Unit-Testing der PySpark-Logik
- Debugging und Codequalitätstandards
End-to-End-Use Cases im Finanzsektor
- Aufbau einer End-to-End-Banking-ETL-Pipeline
- Übersetzung von Legacy-SQL-Prozessen in PySpark
Migrieren von SQL-Workloads zu PySpark
- Migrationsstrategie und Planungsmuster
- Inkrementelle Konvertierung von SQL-Workflows zu PySpark
Voraussetzungen
- Erfahrung mit der Python-Programmierung, einschließlich Funktionen und Datentypen
- Verständnis von SQL, einschließlich Joins, Aggregationen und Unterabfragen
- Keine Vorkenntnisse mit Databricks oder PySpark erforderlich
Zielgruppe
- Data Engineers, Data Analysts und Datenprofis
- Teams, die bestehende SQL-basierte Workflows auf Databricks und PySpark migrieren
Erfahrungsberichte (1)
Ich mochte es, dass es praktisch war. Ich liebte es, die theoretischen Kenntnisse mit praktischen Beispielen anzuwenden.
Aurelia-Adriana - Allianz Services Romania
Kurs - Python and Spark for Big Data (PySpark)
Maschinelle Übersetzung