Temario del curso
Módulo 1: Fundamentos de Big Data y Spark
- Vista general del ecosistema de Big Data y el papel de Spark en las plataformas de datos modernas
- Comprensión de la arquitectura de Spark: driver, ejecutores, administrador de clúster, evaluación perezosa, DAG y planificación de ejecución
- Diferencias entre las APIs de RDD y DataFrame y cuándo utilizar cada enfoque
- Creación y configuración de SparkSession y fundamentos de la configuración de aplicaciones
Módulo 2: DataFrames en PySpark
- Lectura y escritura de datos desde fuentes y formatos empresariales: CSV, JSON, Parquet y Delta
- Trabajo con DataFrames de PySpark: transformaciones, acciones, expresiones de columnas, filtrado, uniones (joins) y agregaciones
- Implementación de operaciones avanzadas como funciones de ventana, manejo de marcas de tiempo y trabajo con datos anidados
- Aplicación de controles de calidad de datos y escritura de código reutilizable y mantenible en PySpark
Módulo 3: Fundamentos de Kubernetes y Docker para usuarios de Spark
- Comprensión de cómo las imágenes de Docker y los pods de Kubernetes se relacionan con los procesos de driver y ejecutor de Spark: una vista conceptual para consumidores del clúster, no administradores
- Comprensión de lo que ocurre cuando un trabajo de Spark se ejecuta en Kubernetes: programación de pods, solicitudes y límites de recursos, y cómo los ajustes de sesión se mapean sobre ellos
- Comprensión de lo que controlas a través de los parámetros de sesión de Spark frente a lo que el equipo de plataforma controla mediante la aprovisionamiento del clúster: y por qué este límite es importante para el ajuste (tuning)
- Ejercicio práctico: Inspeccionar un trabajo de Spark-on-Kubernetes en ejecución en el clúster de arena (sandbox) e identificar los pods de driver y ejecutores
Módulo 4: Configuración de sesión de Spark en Kubernetes: Análisis detallado
- Comprensión de la cantidad de ejecutores frente al tamaño de los ejecutores: compensaciones entre memoria y núcleos y cómo razonar al respecto
- Asignación de memoria para driver y ejecutores, sobrecarga de memoria (memory overhead) y cómo estas se traducen en recursos de pods
- Asignación dinámica: cómo se comporta en Kubernetes, cuándo ahorra recursos y cuándo no
- Ejercicio práctico: Ejecutar el mismo trabajo con diferentes configuraciones de ejecutores y núcleos y comparar el tiempo de ejecución y el uso de recursos
Módulo 5: Comportamiento de Escalado y Optimización de Costos
- Comprensión de cómo agregar o eliminar nodos cambia el comportamiento del trabajo, el tiempo de finalización y el consumo de recursos
- Comparación de muchos ejecutores pequeños frente a unos pocos grandes: compensaciones entre rendimiento y costos
- Comportamiento de shuffle y ajuste de particiones de shuffle, incluyendo la estimación del impacto en costos de las opciones de configuración
- Ejercicio práctico: Escalar el clúster de arena de cinco a diez nodos y observar el efecto en el tiempo de finalización del trabajo y el consumo de recursos
Módulo 6: Ingesta de Datos y Particionamiento Eficientes
- Comprensión del problema de los archivos pequeños: por qué las fuentes divididas en muchos archivos Parquet de 1–5 MB degradan el rendimiento y distorsionan el particionamiento
- Estrategias de re-particionamiento (repartitioning) y coalescing
- Control de los tamaños de partición en la lectura y en la escritura
- Escritura eficiente de Parquet para evitar recrear el problema de archivos pequeños aguas abajo
- Ejercicio práctico: Cargar un conjunto de datos compuesto por muchas particiones Parquet pequeñas, aplicar diferentes estrategias de re-particionamiento y comparar el rendimiento antes y después de la optimización
Módulo 7: Gestión de Memoria y Diagnóstico de Fallas en Pandas
- Comprensión de las causas raíz de los errores de agotamiento de memoria en Pandas y reconocimiento de los síntomas
- Aplicación de patrones de conversión eficientes en memoria entre Spark y Pandas
- Evitar explosiones de memoria al escribir grandes conjuntos de datos en CSV
- Uso de procesamiento por bloques (chunked processing) y optimización de dtype para entornos restringidos
- Ejercicio práctico: Reproducir un escenario típico de agotamiento de memoria en Pandas y resolverlo utilizando procesamiento por bloques y optimización de dtype
Módulo 8: Polars como Herramienta Complementaria
- Posicionamiento de Polars en relación con Pandas: características de rendimiento, evaluación perezosa y comportamiento de memoria
- Comprensión de dónde encaja Polars junto con PySpark y Pandas en las pilas de datos en la nube modernas y los mapas de ruta de migración, incluyendo entornos de AWS
- Ejercicio práctico: Reescribir una transformación intensiva en Pandas con Polars y comparar el uso de memoria y la velocidad de procesamiento
Módulo 9: Aplicación de la Optimización a Cargas de Trabajo de ETL y ML
- Aplicación de principios de configuración, particionamiento y gestión de memoria a través de un pipeline de ETL realista
- Comprensión de consideraciones de optimización específicas para cargas de trabajo de aprendizaje automático que se ejecutan en el mismo clúster
- Aplicación de un flujo de trabajo de ajuste práctico para diagnosticar sistemáticamente problemas de costos y rendimiento
- Ejercicio práctico: Completar un mini proyecto de extremo a extremo que combine la carga de datos, la transformación y un paso simple de entrenamiento de modelo, con los participantes ajustando la configuración de Spark por su cuenta
Requerimientos
Los participantes deben tener:
- Experiencia práctica en programación en Python, incluyendo funciones, módulos y conceptos básicos de programación orientada a objetos.
- Experiencia básica a intermedia en el trabajo con Pandas y flujos de trabajo de procesamiento de datos tabulares.
- Familiaridad básica con PySpark y Spark DataFrames, incluyendo la lectura de datos, transformaciones, acciones, uniones (joins) y agregaciones.
- Comprensión general de SQL y conceptos de procesamiento de datos, incluyendo filtrado, agrupación y unión de conjuntos de datos.
- Familiaridad básica con conceptos de Docker y Kubernetes, como contenedores, imágenes y pods. No se requiere experiencia en administración de Kubernetes.
- Comprensión básica de formatos de datos comunes como CSV, JSON y Parquet.
Los participantes no necesitan ser administradores de Kubernetes ni especialistas en infraestructura. El curso se centra en cómo los ingenieros de datos, los desarrolladores y los científicos de datos pueden comprender y optimizar sus cargas de trabajo de Spark que se ejecutan en Kubernetes desde la perspectiva de la aplicación y la configuración.
Audiencia Objetivo
Este curso está diseñado para profesionales que desarrollan, mantienen u optimizan cargas de trabajo de procesamiento de datos y aprendizaje automático utilizando Python y Spark en entornos en la nube o contenerizados.
Es especialmente adecuado para:
- Ingenieros de Datos que trabajan con PySpark, procesamiento de datos distribuido y pipelines de ETL.
- Científicos de Datos que procesan grandes conjuntos de datos o ejecutan cargas de trabajo de aprendizaje automático con Spark, Pandas o Polars.
- Desarrolladores de Python que trabajan con aplicaciones intensivas en datos y buscan mejorar la eficiencia de memoria y el rendimiento del procesamiento.
- Ingenieros de Aprendizaje Automático que gestionan cargas de trabajo de preparación de datos y entrenamiento de modelos en entornos compartidos de Kubernetes o en la nube.
- Ingenieros Analíticos que trabajan con grandes conjuntos de datos y buscan mejorar la eficiencia del procesamiento de datos.
- Ingenieros DevOps, de Plataforma y de Nube que soportan cargas de trabajo de Spark en Kubernetes y necesitan comprender cómo la configuración a nivel de aplicación afecta el uso de recursos y el rendimiento.
- Líderes Técnicos y Arquitectos de Soluciones involucrados en el diseño u optimización de plataformas modernas de procesamiento de datos.
Reseñas (1)
Me gustó que fuera práctico. Amé aplicar el conocimiento teórico con ejemplos prácticos.
Aurelia-Adriana - Allianz Services Romania
Curso - Python and Spark for Big Data (PySpark)
Traducción Automática