Merci d'avoir envoyé votre demande ! Un membre de notre équipe vous contactera sous peu.
Merci d'avoir envoyé votre réservation ! Un membre de notre équipe vous contactera sous peu.
Plan du cours
Introduction à la mise à l'échelle d'Ollama
- Architecture d'Ollama et considérations relatives à la mise à l'échelle
- Goulots d'étranglement courants dans les déploiements multi-utilisateurs
- Meilleures pratiques pour la préparation de l'infrastructure
Allocation des ressources et optimisation GPU
- Stratégies d'utilisation efficace du CPU/GPU
- Considérations sur la mémoire et la bande passante
- Contraintes de ressources au niveau du conteneur
Déploiement avec conteneurs et Kubernetes
- Conteneurisation d'Ollama avec Docker
- Exécution d'Ollama dans des clusters Kubernetes
- Équilibrage de charge et découverte de services
Automatisation de mise à l'échelle (Autoscaling) et Batch Processing
- Conception de politiques d'automatisation de mise à l'échelle pour Ollama
- Techniques de déduction par lots (batch inference) pour optimiser le débit
- Compromis entre latence et débit
Optimisation de la latence
- Profilage de la performance de la déduction
- Stratégies de mise en cache et préchauffage des modèles
- Réduction des surcoûts I/O et de communication
Supervision et Observabilité
- Intégration de Prometheus pour les métriques
- Création de tableaux de bord avec Grafana
- Alertes et gestion des incidents pour l'infrastructure Ollama
Gestion des coûts et stratégies de mise à l'échelle
- Allocation des GPU tenant compte des coûts
- Considérations sur le déploiement Cloud vs. On-premise
- Stratégies pour une mise à l'échelle durable
Résumé et prochaines étapes
Pré requis
- Expérience en administration de systèmes Linux
- Compréhension de la conteneurisation et de l'orchestration
- Familiarité avec le déploiement de modèles de machine learning
Public cible
- Ingénieurs DevOps
- Équipes d'infrastructure ML
- Ingénieurs de la fiabilité des sites (SRE)
21 Heures