Ponte en Contacto

Temario del curso

Introducción al escalado de Ollama

  • Arquitectura de Ollama y consideraciones para el escalado
  • Cuellos de botella comunes en despliegues multiusuario
  • Buenas prácticas para la preparación de la infraestructura

Asignación de recursos y optimización de GPU

  • Estrategias para una eficiente utilización de CPU/GPU
  • Consideraciones sobre memoria y ancho de banda
  • Restricciones de recursos a nivel de contenedor

Despliegue con contenedores y Kubernetes

  • Contenerización de Ollama con Docker
  • Ejecución de Ollama en clústeres de Kubernetes
  • Balanceo de carga y descubrimiento de servicios

Escalado automático y procesamiento por lotes

  • Diseño de políticas de escalado automático para Ollama
  • Técnicas de inferencia por lotes para la optimización del rendimiento
  • Compromisos entre latencia y rendimiento (throughput)

Optimización de la latencia

  • Perfiles de rendimiento de inferencia (profiling)
  • Estrategias de almacenamiento en caché y calentamiento del modelo
  • Reducción de la sobrecarga de E/S y comunicación

Monitoreo y observabilidad

  • Integración de Prometheus para métricas
  • Creación de tableros con Grafana
  • Alertas y respuesta ante incidentes para la infraestructura de Ollama

Gestión de costos y estrategias de escalado

  • Asignación de GPU con conciencia de costos
  • Consideraciones para el despliegue en la nube vs. en las instalaciones
  • Estrategias para un escalado sostenible

Resumen y próximos pasos

Requerimientos

  • Experiencia en administración de sistemas Linux.
  • Comprensión de la contenerización y orquestación.
  • Familiaridad con el despliegue de modelos de aprendizaje automático.

Público objetivo

  • Ingenieros de DevOps.
  • Equipos de infraestructura de ML.
  • Ingenieros de confiabilidad del sitio (SRE).
 21 Horas

Número de participantes


Precio por participante

Próximos cursos

Categorías Relacionadas