Obrigado por enviar sua consulta! Um dos membros da nossa equipe entrará em contato com você em breve.
Obrigado por enviar sua reserva! Um dos membros da nossa equipe entrará em contato com você em breve.
Programa do Curso
Introdução ao AIOps Preditivo
- Visão geral da análise preditiva nas operações de TI
- Fontes de dados para predição (logs, métricas, eventos)
- Conceitos-chave em previsão de séries temporais e padrões de anomalia
Projetando Modelos de Previsão de Incidentes
- Rótulos para incidentes históricos e comportamento do sistema
- Escolha e treinamento de modelos (ex.: LSTM, Random Forest, AutoML)
- Avaliação do desempenho do modelo e tratamento de falsos positivos
Coleta de Dados e Engenharia de Características
- Ingestão e alinhamento de dados de logs e métricas para entrada no modelo
- Extração de características de dados estruturados e não estruturados
- Tratamento de ruído e dados ausentes em pipelines operacionais
Automatizando a Análise de Causa Raiz (RCA)
- Correlação baseada em grafo de serviços e infraestrutura
- Uso de ML para inferir causas raiz prováveis a partir de cadeias de eventos
- Visualização de RCA com dashboards conscientes da topologia
Correção e Automação de Fluxos de Trabalho
- Integração com plataformas de automação (ex.: Ansible, Rundeck)
- Acionamento de rollbacks, reinícios ou redirecionamento de tráfego
- Auditoria e documentação de intervenções automatizadas
Escalando Pipelines Inteligentes de AIOps
- MLOps para observabilidade: re-treinamento e versionamento de modelos
- Execução de previsões em tempo real em nós distribuídos
- Boas práticas para implantação de AIOps em ambientes de produção
Estudos de Caso e Aplicações Práticas
- Análise de dados reais de incidentes usando modelos preditivos de AIOps
- Implantação de pipelines de RCA com dados sintéticos e de produção
- Revisão de casos de uso da indústria: falhas em nuvem, instabilidade de microsserviços, degradação de rede
Resumo e Próximos Passos
Requisitos
- Experiência com sistemas de monitoramento, como Prometheus ou ELK
- Conhecimento funcional de Python e noções básicas de aprendizado de máquina
- Familiaridade com fluxos de trabalho de gerenciamento de incidentes
Público Alvo
- Engenheiros de confiabilidade de sites sêniores (SREs)
- Arquitetos de automação de TI
- Líderes de plataformas DevOps e observabilidade
14 Horas