Acest curs practic de trei zile se concentrează pe construirea și optimizarea workload-urilor eficiente de procesare a datelor, folosind PySpark, Pandas și Polars în medii bazate pe Kubernetes.
Vei dezvolta o înțelegere practică a modului în care aplicațiile Spark se execută pe Kubernetes și cum deciziile de configurare la nivel de aplicație influențează performanța, scalabilitatea, consumul de resurse și costurile. Cursul acoperă zone-cheie de optimizare, inclusiv dimensionarea executorilor, alocarea memoriei, alocarea dinamică, strategiile de partiționare, comportamentul shuffle, problemele legate de fișierele mici și procesarea eficientă a formatului Parquet.
De asemenea, cursul abordează provocările comune cu care te confrunți la lucrul cu Pandas, precum limitările de memorie și erorile de tip out-of-memory, și introduce Polars ca alternativă de înaltă performanță pentru anumite workload-uri de procesare a datelor. Prin exerciții hands-on, vei diagnostica problemele de performanță și de memorie, vei compara diferite strategii de configurare și vei aplica tehnici de optimizare în scenarii realiste de ETL și machine learning.
Accentul din tot cursul este pus pe luarea deciziilor practice: înțelegerea modului de identificare a blocajelor, selectarea instrumentului potrivit, configurarea eficientă a Spark și echilibrarea performanței cu consumul de resurse de infrastructură și costuri.
Citește mai mult...