Ponte en Contacto

Temario del curso

Módulo 1: Fundamentos de Big Data y Spark

  • Vista general del ecosistema de Big Data y el papel de Spark en las plataformas de datos modernas
  • Comprensión de la arquitectura de Spark: driver, ejecutores, administrador de clúster, evaluación perezosa, DAG y planificación de ejecución
  • Diferencias entre las APIs de RDD y DataFrame y cuándo utilizar cada enfoque
  • Creación y configuración de SparkSession y fundamentos de la configuración de aplicaciones

Módulo 2: DataFrames en PySpark

  • Lectura y escritura de datos desde fuentes y formatos empresariales: CSV, JSON, Parquet y Delta
  • Trabajo con DataFrames de PySpark: transformaciones, acciones, expresiones de columnas, filtrado, uniones (joins) y agregaciones
  • Implementación de operaciones avanzadas como funciones de ventana, manejo de marcas de tiempo y trabajo con datos anidados
  • Aplicación de controles de calidad de datos y escritura de código reutilizable y mantenible en PySpark

Módulo 3: Fundamentos de Kubernetes y Docker para usuarios de Spark

  • Comprensión de cómo las imágenes de Docker y los pods de Kubernetes se relacionan con los procesos de driver y ejecutor de Spark: una vista conceptual para consumidores del clúster, no administradores
  • Comprensión de lo que ocurre cuando un trabajo de Spark se ejecuta en Kubernetes: programación de pods, solicitudes y límites de recursos, y cómo los ajustes de sesión se mapean sobre ellos
  • Comprensión de lo que controlas a través de los parámetros de sesión de Spark frente a lo que el equipo de plataforma controla mediante la aprovisionamiento del clúster: y por qué este límite es importante para el ajuste (tuning)
  • Ejercicio práctico: Inspeccionar un trabajo de Spark-on-Kubernetes en ejecución en el clúster de arena (sandbox) e identificar los pods de driver y ejecutores

Módulo 4: Configuración de sesión de Spark en Kubernetes: Análisis detallado

  • Comprensión de la cantidad de ejecutores frente al tamaño de los ejecutores: compensaciones entre memoria y núcleos y cómo razonar al respecto
  • Asignación de memoria para driver y ejecutores, sobrecarga de memoria (memory overhead) y cómo estas se traducen en recursos de pods
  • Asignación dinámica: cómo se comporta en Kubernetes, cuándo ahorra recursos y cuándo no
  • Ejercicio práctico: Ejecutar el mismo trabajo con diferentes configuraciones de ejecutores y núcleos y comparar el tiempo de ejecución y el uso de recursos

Módulo 5: Comportamiento de Escalado y Optimización de Costos

  • Comprensión de cómo agregar o eliminar nodos cambia el comportamiento del trabajo, el tiempo de finalización y el consumo de recursos
  • Comparación de muchos ejecutores pequeños frente a unos pocos grandes: compensaciones entre rendimiento y costos
  • Comportamiento de shuffle y ajuste de particiones de shuffle, incluyendo la estimación del impacto en costos de las opciones de configuración
  • Ejercicio práctico: Escalar el clúster de arena de cinco a diez nodos y observar el efecto en el tiempo de finalización del trabajo y el consumo de recursos

Módulo 6: Ingesta de Datos y Particionamiento Eficientes

  • Comprensión del problema de los archivos pequeños: por qué las fuentes divididas en muchos archivos Parquet de 1–5 MB degradan el rendimiento y distorsionan el particionamiento
  • Estrategias de re-particionamiento (repartitioning) y coalescing
  • Control de los tamaños de partición en la lectura y en la escritura
  • Escritura eficiente de Parquet para evitar recrear el problema de archivos pequeños aguas abajo
  • Ejercicio práctico: Cargar un conjunto de datos compuesto por muchas particiones Parquet pequeñas, aplicar diferentes estrategias de re-particionamiento y comparar el rendimiento antes y después de la optimización

Módulo 7: Gestión de Memoria y Diagnóstico de Fallas en Pandas

  • Comprensión de las causas raíz de los errores de agotamiento de memoria en Pandas y reconocimiento de los síntomas
  • Aplicación de patrones de conversión eficientes en memoria entre Spark y Pandas
  • Evitar explosiones de memoria al escribir grandes conjuntos de datos en CSV
  • Uso de procesamiento por bloques (chunked processing) y optimización de dtype para entornos restringidos
  • Ejercicio práctico: Reproducir un escenario típico de agotamiento de memoria en Pandas y resolverlo utilizando procesamiento por bloques y optimización de dtype

Módulo 8: Polars como Herramienta Complementaria

  • Posicionamiento de Polars en relación con Pandas: características de rendimiento, evaluación perezosa y comportamiento de memoria
  • Comprensión de dónde encaja Polars junto con PySpark y Pandas en las pilas de datos en la nube modernas y los mapas de ruta de migración, incluyendo entornos de AWS
  • Ejercicio práctico: Reescribir una transformación intensiva en Pandas con Polars y comparar el uso de memoria y la velocidad de procesamiento

Módulo 9: Aplicación de la Optimización a Cargas de Trabajo de ETL y ML

  • Aplicación de principios de configuración, particionamiento y gestión de memoria a través de un pipeline de ETL realista
  • Comprensión de consideraciones de optimización específicas para cargas de trabajo de aprendizaje automático que se ejecutan en el mismo clúster
  • Aplicación de un flujo de trabajo de ajuste práctico para diagnosticar sistemáticamente problemas de costos y rendimiento
  • Ejercicio práctico: Completar un mini proyecto de extremo a extremo que combine la carga de datos, la transformación y un paso simple de entrenamiento de modelo, con los participantes ajustando la configuración de Spark por su cuenta

Requerimientos

Los participantes deben tener:

  • Experiencia práctica en programación en Python, incluyendo funciones, módulos y conceptos básicos de programación orientada a objetos.
  • Experiencia básica a intermedia en el trabajo con Pandas y flujos de trabajo de procesamiento de datos tabulares.
  • Familiaridad básica con PySpark y Spark DataFrames, incluyendo la lectura de datos, transformaciones, acciones, uniones (joins) y agregaciones.
  • Comprensión general de SQL y conceptos de procesamiento de datos, incluyendo filtrado, agrupación y unión de conjuntos de datos.
  • Familiaridad básica con conceptos de Docker y Kubernetes, como contenedores, imágenes y pods. No se requiere experiencia en administración de Kubernetes.
  • Comprensión básica de formatos de datos comunes como CSV, JSON y Parquet.

Los participantes no necesitan ser administradores de Kubernetes ni especialistas en infraestructura. El curso se centra en cómo los ingenieros de datos, los desarrolladores y los científicos de datos pueden comprender y optimizar sus cargas de trabajo de Spark que se ejecutan en Kubernetes desde la perspectiva de la aplicación y la configuración.

Audiencia Objetivo

Este curso está diseñado para profesionales que desarrollan, mantienen u optimizan cargas de trabajo de procesamiento de datos y aprendizaje automático utilizando Python y Spark en entornos en la nube o contenerizados.

Es especialmente adecuado para:

  • Ingenieros de Datos que trabajan con PySpark, procesamiento de datos distribuido y pipelines de ETL.
  • Científicos de Datos que procesan grandes conjuntos de datos o ejecutan cargas de trabajo de aprendizaje automático con Spark, Pandas o Polars.
  • Desarrolladores de Python que trabajan con aplicaciones intensivas en datos y buscan mejorar la eficiencia de memoria y el rendimiento del procesamiento.
  • Ingenieros de Aprendizaje Automático que gestionan cargas de trabajo de preparación de datos y entrenamiento de modelos en entornos compartidos de Kubernetes o en la nube.
  • Ingenieros Analíticos que trabajan con grandes conjuntos de datos y buscan mejorar la eficiencia del procesamiento de datos.
  • Ingenieros DevOps, de Plataforma y de Nube que soportan cargas de trabajo de Spark en Kubernetes y necesitan comprender cómo la configuración a nivel de aplicación afecta el uso de recursos y el rendimiento.
  • Líderes Técnicos y Arquitectos de Soluciones involucrados en el diseño u optimización de plataformas modernas de procesamiento de datos.
 21 Horas

Número de participantes


Precio por participante

Reseñas (1)

Próximos cursos

Categorías Relacionadas