Mulțumim pentru trimiterea solicitării! Un membru al echipei noastre vă va contacta în curând.
Mulțumim pentru trimiterea rezervării! Un membru al echipei noastre vă va contacta în curând.
Schița de curs
Introducere în AIOps predictiv
- Prezentare generală a analiticii predictive în operațiunile IT
- Surse de date pentru predicție (loguri, metrici, evenimente)
- Concepte cheie în forecasting de serii temporale și tipare de anomalii
Proiectarea modelelor de predicție a incidentelor
- Etichetarea incidentelor istorice și a comportamentului sistemului
- Alegerea și antrenarea modelelor (de exemplu, LSTM, Random Forest, AutoML)
- Evaluarea performanței modelului și gestionarea falselor pozitive
Colectarea datelor și feature engineering
- Ingestia și alinierea datelor de log și metrici pentru inputul modelului
- Extragerea de feature-uri din date structurate și nestructurate
- Gestionarea zgomotului și a datelor lipsă în pipeline-urile operaționale
Automatizarea analizei cauzei rădăcină (RCA)
- Corelarea bazată pe grafuri a serviciilor și infrastructurii
- Folosirea ML pentru a deduce cauzele rădăcină probabile din lanțuri de evenimente
- Vizualizarea RCA cu dashboard-uri conștiente de topologie
Remediere și automatizarea fluxurilor de lucru
- Integrarea cu platforme de automatizare (de exemplu, Ansible, Rundeck)
- Declanșarea de rollback-uri, restarturi sau redirecționarea traficului
- Auditarea și documentarea intervențiilor automatizate
Scalarea pipeline-urilor inteligente de AIOps
- MLOps pentru observability: reantrenare și versionarea modelelor
- Rularea predicțiilor în timp real pe noduri distribuite
- Cele mai bune practici pentru implementarea AIOps în medii de producție
Studii de caz și aplicații practice
- Analiza datelor reale de incidente folosind modele predictive de AIOps
- Implementarea pipeline-urilor de RCA cu date sintetice și de producție
- Revizuirea cazurilor de utilizare din industrie: întreruperi cloud, instabilitate microservicii, degradări ale rețelei
Rezumat și pașii următori
Cerințe
- Experiență cu sisteme de monitorizare precum Prometheus sau ELK
- Cunoștințe practice de Python și machine learning de bază
- Familiaritate cu fluxurile de management al incidentelor
Public țintă
- Ingineri seniori de site reliability (SRE)
- Arhitecți de automatizare IT
- Lideri de platforme DevOps și observability
14 Ore