感谢您发送咨询!我们的团队成员将很快与您联系。
感谢您发送预订!我们的团队成员将很快与您联系。
课程大纲
AI 观测性全景
- 从仪表板到对话:向 AI 增强型观测性的转变
- 与观测性相关的 LLM 能力:摘要、推理、模式匹配
- 架构模式:将 AI 集成到现有观测性技术栈中
自然语言遥测查询
- Text-to-PromQL:将自然语言转换为监控查询
- 针对 Elasticsearch、OpenSearch 和 Loki 日志存储的 NL 查询
- 从自然语言生成结构化遥测数据的 SQL 语句
- 构建具备工具使用能力和上下文感知能力的查询助手代理
基于 LLM 的日志分析
- 利用 LLM 进行自动日志解析和结构化
- 使用嵌入相似度在日志流中进行异常检测
- 大规模日志聚类和模式发现
- 从原始日志序列生成人类可读的解释
智能告警与事件丰富
- 基于语义理解的告警关联与去重
- 从运行手册、过往事件和文档中自动收集事件上下文
- 基于内容理解和团队专业知识进行智能告警路由
- 通过 AI 驱动噪声减少降低告警疲劳
AI 辅助的根本原因分析
- 从多源遥测关联中生成假设
- 证据链:连接跨指标、日志和跟踪的症状
- 通过交互式 AI 诊断会话进行引导式故障排除
- 构建具备渐进式调查功能的根本原因分析代理
自动事件响应与沟通
- 从遥测数据生成事件摘要和状态更新
- 通过时间线重建自动生成事后报告草稿
- 针对技术和管理受众定制利益相关者沟通
- 运行手册建议及自动修复推荐
观测性中的机器学习
- 用于容量规划和异常预测的时间序列预测
- 用于指标零样本异常检测的基础模型
- 基于嵌入的服务依赖映射和拓扑发现
- 在观测性流水线旁训练和部署轻量级 ML 模型
生产部署与伦理
- 实时 AI 观测性的延迟与成本考量
- 数据隐私:确保 LLM 不泄露敏感遥测数据
- 人工监督:何时需要操作员验证 AI 诊断结果
- 衡量影响:平均检测时间 (MTTD)、平均修复时间 (MTTR) 及值班体验指标
要求
- 具备 Prometheus、Grafana、Datadog 或 OpenTelemetry 等观测性工具的使用经验。
- 熟悉日志管理和指标概念。
- 具备用于数据处理的基础 Python 脚本编写能力。
受众
- 采用 AI 增强型工具的 SRE 和观测性工程师。
- 构建下一代监控流水线的平台工程师。
- 评估将 LLM 集成到事件工作流中的 DevOps 负责人。
14 小时