Dieser dreitägige, praxisorientierte Kurs konzentriert sich auf den Aufbau und die Optimierung effizienter Datenverarbeitungs-Workloads unter Verwendung von PySpark, Pandas und Polars in Kubernetes-basierten Umgebungen.
Die Teilnehmer entwickeln ein praxisnahes Verständnis dafür, wie Spark-Anwendungen auf Kubernetes ausgeführt werden und wie Konfigurationsentscheidungen auf Anwendungsebene Performance, Skalierbarkeit, Ressourcenverbrauch und Kosten beeinflussen. Der Kurs deckt zentrale Optimierungsbereiche ab, einschließlich der Dimensionierung von Executoren, Speicherallokierung, dynamischer Allokierung, Partitionierungsstrategien, Shuffle-Verhalten, dem Problem kleiner Dateien und der effizienten Verarbeitung von Parquet-Dateien.
Außerdem widmet sich der Kurs häufigen Herausforderungen bei der Arbeit mit Pandas, wie etwa Speicherlimitierungen und Speicherüberlauf-Fehlern (Out-of-memory), und stellt Polars als hochperformante Alternative für ausgewählte Datenverarbeitungs-Workloads vor. In praktischen Übungen diagnostizieren die Teilnehmer Leistungs- und Speicherprobleme, vergleichen unterschiedliche Konfigurationsstrategien und wenden Optimierungstechniken auf realistische ETL- und Machine-Learning-Szenarien an.
Der Fokus liegt während des gesamten Kurses auf praktischer Entscheidungsfindung: es geht darum, Engpässe zu identifizieren, die richtigen Werkzeuge auszuwählen, Spark effizient zu konfigurieren und ein Gleichgewicht zwischen Performance, Infrastrukturressourcenverbrauch und Kosten zu finden.
Mehr Informationen...