Grazie per aver inviato la tua richiesta! Uno dei nostri team membri ti contatterà a breve.
Grazie per aver inviato il tuo prenotazione! Uno dei nostri team membri ti contatterà a breve.
Struttura del corso
Introduzione all'AIOps
- Cos'è l'AIOps e perché è importante
- Monitoraggio tradizionale vs. osservabilità guidata dall'AIOps
- Architettura AIOps e componenti chiave
Raccolta e Normalizzazione dei Dati Operativi
- Tipi di dati di osservabilità: metriche, log e tracciamenti
- Ingestione di dati da più fonti (server, contenitori, cloud)
- Utilizzo di agenti ed esportatori (Prometheus, Beats, Fluentd)
Correlazione dei Dati e Rilevamento delle Anomalie
- Correlazione delle serie temporali e metodi statistici
- Utilizzo di modelli di apprendimento automatico per il rilevamento delle anomalie
- Rilevamento degli incidenti nei sistemi distribuiti
Allerte e Riduzione del Rumore
- Progettazione di regole di allarme e soglie intelligenti
- Soppressione, deduplicazione e raggruppamento delle allerte
- Integrazione con Alertmanager, Slack, PagerDuty o Opsgenie
Analisi delle Cause Radice e Visualizzazione
- Utilizzo di dashboard per visualizzare le metriche e rilevare le tendenze
- Esplorazione di eventi e cronologie per l'analisi delle cause radice (RCA)
- Tracciamento dei problemi tra i livelli con strumenti di tracciamento distribuito
Automazione e Riparazione
- Attivazione di script o flussi di lavoro automatizzati da incidenti
- Integrazione con i sistemi ITSM (ServiceNow, Jira)
- Casi d'uso: auto-riparazione, scaling, instradamento del traffico
Piattaforme AIOps Open Source e Commerciali
- Panoramica degli strumenti: Prometheus, Grafana, ELK, Moogsoft, Dynatrace
- Criteri di valutazione per la selezione di una piattaforma AIOps
- Demo e pratica con uno stack selezionato
Riepilogo e Prossimi Passi
Requisiti
- Una comprensione dei concetti di operazioni IT e monitoraggio dei sistemi
- Esperienza con strumenti di monitoraggio o dashboard
- Familiarità con i formati base di log e metriche
Pubblico Target
- Team operativi responsabili di infrastrutture e applicazioni
- Ingegneri di Affidabilità dei Siti (SRE)
- Team di monitoraggio IT e osservabilità
14 ore