联系我们

课程大纲

AI增强的Kubernetes运维简介

  • 为何AI对现代集群运维至关重要
  • 传统扩缩容和调度逻辑的局限性
  • 资源管理中ML的关键概念

Kubernetes资源管理基础

  • CPU、GPU和内存分配基础
  • 理解配额、限制和请求
  • 识别瓶颈和低效环节

机器学习的调度方法

  • 用于工作负载放置的监督和无监督模型
  • 资源需求的预测算法
  • 在自定义调度器中使用ML特征

强化学习实现智能自动扩缩容

  • RL代理如何从集群行为中学习
  • 设计高效奖励函数
  • 构建RL驱动的自动扩缩容策略

基于指标和遥测的预测性自动扩缩容

  • 使用Prometheus数据进行预测
  • 将时间序列模型应用于自动扩缩容
  • 评估预测准确性并调整模型

实施AI驱动的优化工具

  • 将ML框架与Kubernetes控制器集成
  • 部署智能控制循环
  • 扩展KEDA以支持AI辅助决策

成本和性能优化策略

  • 通过预测性扩缩容降低计算成本
  • 利用ML驱动的放置提高GPU利用率
  • 平衡延迟、吞吐量和效率

实际场景和真实用例

  • 使用AI自动扩缩容高负载应用
  • 优化异构节点池
  • 将ML应用于多租户环境

总结与后续步骤

要求

  • 理解Kubernetes基础知识
  • 具有容器化应用部署经验
  • 熟悉集群操作和资源管理

目标受众

  • 负责大规模分布式系统的SRE
  • 管理高需求工作负载的Kubernetes运维人员
  • 优化计算基础设施的平台工程师
 21 小时

客户评论 (4)

即将举行的公开课程

课程分类