Благодарим ви, че изпратихте вашето запитване! Един от членовете на нашия екип ще се свърже с вас скоро.
Благодарим ви, че направихте своята резервация! Един от членовете на нашия екип ще се свърже с вас скоро.
Съдържание и теми, включени в курса
Въведение в AIOps
- Какво е AIOps и защо има значение
- Традиционен мониторинг срещу наблюдаемост, управлявана от AIOps
- Архитектура и ключови компоненти на AIOps
Събиране и нормализиране на оперативни данни
- Видове данни за наблюдаемост: метрики, логове и трасета
- Поглъщане на данни от множество източници (сървъри, контейнери, облак)
- Използване на агенти и експортери (Prometheus, Beats, Fluentd)
Корелация на данни и откриване на аномалии
- Корелация на времеви редове и статистически методи
- Използване на ML модели за откриване на аномалии
- Откриване на инциденти в разпределени системи
Известяване и намаляване на шума
- Проектиране на интелигентни правила и прагове за известяване
- Потискане, дедупликация и групиране на известявания
- Интеграция с Alertmanager, Slack, PagerDuty или Opsgenie
Анализ на първопричините и визуализация
- Използване на табла за визуализиране на метрики и откриване на тенденции
- Изследване на събития и времеви линии за RCA
- Проследяване на проблеми през слоевете с инструменти за разпределено трасиране
Автоматизация и отстраняване
- Задействане на автоматизирани скриптове или работни потоци от инциденти
- Интеграция с ITSM системи (ServiceNow, Jira)
- Случаи на употреба: самовъзстановяване, мащабиране, пренасочване на трафик
Open Source и търговски AIOps платформи
- Преглед на инструменти: Prometheus, Grafana, ELK, Moogsoft, Dynatrace
- Критерии за оценка при избор на AIOps платформа
- Демонстрация и практическа работа с избран стек
Обобщение и следващи стъпки
Изисквания
- Разбиране на ИТ операциите и концепциите за системен мониторинг
- Опит с инструменти за мониторинг или табла
- Познаване на основните формати на логове и метрики
Аудитория
- Оперативни екипи, отговорни за инфраструктурата и приложенията
- Инженери по надеждност на сайта (SRE)
- Екипи по ИТ мониторинг и наблюдаемост
14 Часа