Gracias por enviar su consulta! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Gracias por enviar su reserva! Uno de los miembros de nuestro equipo se pondrá en contacto con usted en breve.
Temario del curso
Introducción a la escalabilidad de Ollama
- Arquitectura de Ollama y consideraciones de escalado
- Cuellos de botella comunes en despliegues de múltiples usuarios
- Mejores prácticas para la preparación de la infraestructura
Asignación de Recursos y Optimización de GPU
- Estrategias de uso eficiente de CPU/GPU
- Consideraciones de memoria y ancho de banda
- Restricciones de recursos a nivel de contenedor
Despliegue con Contenedores y Kubernetes
- Contenerización de Ollama con Docker
- Ejecución de Ollama en clusters de Kubernetes
- Balanceo de carga y descubrimiento de servicios
Autoescalado y Loteo (Batching)
- Diseño de políticas de autoescalado para Ollama
- Técnicas de inferencia por lotes para optimizar el rendimiento
- Compromisos entre latencia y rendimiento (throughput)
Optimización de Latencia
- Perfilización del rendimiento de inferencia
- Estrategias de caché y calentamiento de modelos
- Reducción de la sobrecarga de E/S y comunicación
Monitoreo y Observabilidad
- Integración de Prometheus para métricas
- Creación de paneles de control (dashboards) con Grafana
- Alertas y respuesta a incidentes para la infraestructura de Ollama
Gestión de Costos y Estrategias de Escalado
- Asignación de GPU con enfoque en costos
- Consideraciones de despliegue en la nube vs. en sitio (on-prem)
- Estrategias para un escalado sostenible
Resumen y Siguientes Pasos
Requerimientos
- Experiencia en administración de sistemas Linux
- Conocimiento de la contenerización y la orquestación
- Familiaridad con el despliegue de modelos de aprendizaje automático
Audiencia
- Ingenieros de DevOps
- Equipos de infraestructura de ML
- Ingenieros de confiabilidad del sitio (SRE)
21 Horas