Ponte en Contacto

Temario del curso

Introducción a la Escalarización de Ollama

  • Arquitectura de Ollama y consideraciones para el escalado
  • Cuellos de botella comunes en implementaciones multiusuario
  • Prácticas recomendadas para la preparación de la infraestructura

Asignación de Recursos y Optimización de GPU

  • Estrategias de uso eficiente de CPU/GPU
  • Consideraciones sobre memoria y ancho de banda
  • Restricciones de recursos a nivel de contenedor

Implementación con Contenedores y Kubernetes

  • Contenerización de Ollama con Docker
  • Ejecución de Ollama en clústeres de Kubernetes
  • Balanceo de carga y descubrimiento de servicios

Escalado Automático y Procesamiento por Lotes

  • Diseño de políticas de escalado automático para Ollama
  • Técnicas de inferencia por lotes para optimizar el rendimiento (throughput)
  • Compromisos entre latencia y rendimiento (throughput)

Optimización de Latencia

  • Perfiles de rendimiento de la inferencia
  • Estrategias de almacenamiento en caché y calentamiento de modelos
  • Reducción de la sobrecarga de E/S y comunicación

Monitoreo y Observabilidad

  • Integración de Prometheus para métricas
  • Creación de tableros (dashboards) con Grafana
  • Alertas y respuesta a incidentes para la infraestructura de Ollama

Gestión de Costos y Estrategias de Escalado

  • Asignación de GPU consciente de los costos
  • Consideraciones sobre implementación en la nube frente a local (on-premises)
  • Estrategias para un escalado sostenible

Resumen y Próximos Pasos

Requerimientos

  • Experiencia en administración de sistemas Linux
  • Comprensión de la contenerización y orquestación
  • Conocimiento sobre la implementación de modelos de aprendizaje automático

Público Objetivo

  • Ingenieros DevOps
  • Equipos de infraestructura de IA/ML
  • Ingenieros de confiabilidad de sitios (SRE)
 21 Horas

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas