Prenez contact avec nous

Plan du cours

Introduction à la mise à l'échelle d'Ollama

  • Architecture d'Ollama et considérations relatives à la mise à l'échelle
  • Goulots d'étranglement courants dans les déploiements multi-utilisateurs
  • Meilleures pratiques pour la préparation de l'infrastructure

Allocation des ressources et optimisation GPU

  • Stratégies d'utilisation efficace du CPU/GPU
  • Considérations sur la mémoire et la bande passante
  • Contraintes de ressources au niveau du conteneur

Déploiement avec conteneurs et Kubernetes

  • Conteneurisation d'Ollama avec Docker
  • Exécution d'Ollama dans des clusters Kubernetes
  • Équilibrage de charge et découverte de services

Automatisation de mise à l'échelle (Autoscaling) et Batch Processing

  • Conception de politiques d'automatisation de mise à l'échelle pour Ollama
  • Techniques de déduction par lots (batch inference) pour optimiser le débit
  • Compromis entre latence et débit

Optimisation de la latence

  • Profilage de la performance de la déduction
  • Stratégies de mise en cache et préchauffage des modèles
  • Réduction des surcoûts I/O et de communication

Supervision et Observabilité

  • Intégration de Prometheus pour les métriques
  • Création de tableaux de bord avec Grafana
  • Alertes et gestion des incidents pour l'infrastructure Ollama

Gestion des coûts et stratégies de mise à l'échelle

  • Allocation des GPU tenant compte des coûts
  • Considérations sur le déploiement Cloud vs. On-premise
  • Stratégies pour une mise à l'échelle durable

Résumé et prochaines étapes

Pré requis

  • Expérience en administration de systèmes Linux
  • Compréhension de la conteneurisation et de l'orchestration
  • Familiarité avec le déploiement de modèles de machine learning

Public cible

  • Ingénieurs DevOps
  • Équipes d'infrastructure ML
  • Ingénieurs de la fiabilité des sites (SRE)
 21 Heures

Nombre de participants


Prix par participant

Cours à venir

Catégories Similaires