Intrati in legatura

Schița de curs

Introducere în AIOps predictiv

  • Prezentare generală a analiticii predictive în operațiunile IT
  • Surse de date pentru predicție (loguri, metrici, evenimente)
  • Concepte cheie în forecasting de serii temporale și tipare de anomalii

Proiectarea modelelor de predicție a incidentelor

  • Etichetarea incidentelor istorice și a comportamentului sistemului
  • Alegerea și antrenarea modelelor (de exemplu, LSTM, Random Forest, AutoML)
  • Evaluarea performanței modelului și gestionarea falselor pozitive

Colectarea datelor și feature engineering

  • Ingestia și alinierea datelor de log și metrici pentru inputul modelului
  • Extragerea de feature-uri din date structurate și nestructurate
  • Gestionarea zgomotului și a datelor lipsă în pipeline-urile operaționale

Automatizarea analizei cauzei rădăcină (RCA)

  • Corelarea bazată pe grafuri a serviciilor și infrastructurii
  • Folosirea ML pentru a deduce cauzele rădăcină probabile din lanțuri de evenimente
  • Vizualizarea RCA cu dashboard-uri conștiente de topologie

Remediere și automatizarea fluxurilor de lucru

  • Integrarea cu platforme de automatizare (de exemplu, Ansible, Rundeck)
  • Declanșarea de rollback-uri, restarturi sau redirecționarea traficului
  • Auditarea și documentarea intervențiilor automatizate

Scalarea pipeline-urilor inteligente de AIOps

  • MLOps pentru observability: reantrenare și versionarea modelelor
  • Rularea predicțiilor în timp real pe noduri distribuite
  • Cele mai bune practici pentru implementarea AIOps în medii de producție

Studii de caz și aplicații practice

  • Analiza datelor reale de incidente folosind modele predictive de AIOps
  • Implementarea pipeline-urilor de RCA cu date sintetice și de producție
  • Revizuirea cazurilor de utilizare din industrie: întreruperi cloud, instabilitate microservicii, degradări ale rețelei

Rezumat și pașii următori

Cerințe

  • Experiență cu sisteme de monitorizare precum Prometheus sau ELK
  • Cunoștințe practice de Python și machine learning de bază
  • Familiaritate cu fluxurile de management al incidentelor

Public țintă

  • Ingineri seniori de site reliability (SRE)
  • Arhitecți de automatizare IT
  • Lideri de platforme DevOps și observability
 14 Ore

Numărul de participanți


Pret per participant

Cursuri viitoare

Categorii înrudite