Skip to content

Folders and files

NameName
Last commit message
Last commit date

Latest commit

 

History

20 Commits
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

Фонд оценочных средств по дисциплине «Развертывание и эксплуатация систем ИИ»

Этот репозиторий предназначен для открытого и воспроизводимого представления фонда оценочных средств (ФОС) по дисциплине «Развертывание и эксплуатация систем ИИ». Здесь объединены рабочая программа дисциплины, модель измерения результатов обучения, контрольно-измерительные материалы (КИМ), критерии оценивания, методические рекомендации и используемые образовательные ресурсы. Результаты обучения связываются с компетентностно-ролевой моделью в области искусственного интеллекта (КРМ версии 3.0).

Быстрая навигация

1. О дисциплине

Общие слова. В рамках подготовки кадров по направлению ИИ имеем сильный перекос в "математиков" (людей-мечтателей, которые занимаются фронтирными задачами), "вайбкодеров" (пользователи ИИ инструментов, думая, что они умеют программировать). Но при желании подготовки инженеров (а именно инженерные задачи бизнеса приносят деньги) необходимо выдавать реальные задачи применения ИИ. Причем немаловажным местом применения ИИ является совместное использование серверных (БЯМ требуют много ресурсов) локальных (личные данные компании) моделей на группу лиц для различных целей (программирование, RAG системы, ведение проектов и другое). Хочется показать студентам как с этим жить. Ключевой акцент — переход от «запустил локально — работает» к «запустил в проде — выдерживает нагрузку группы из 30 человек».

Цель дисциплины. Подготовить специалистов, способных самостоятельно разворачивать, масштабировать и сопровождать системы ИИ в production-среде с учётом реальных ограничений инфраструктуры, нагрузки и пользовательского опыта.

Основные задачи.

  • изучить инструменты контейнеризации, серверы инференса, оркестрацию и мониторинг ИИ-сервисов (КРМ: LC-5.1);
  • освоить построение инфраструктуры данных и RAG-контуров с разграничением доступа и резервированием (КРМ: LC-5.2);
  • научиться проводить нагрузочное тестирование, формулировать и доказывать SLA, планировать мощности (КРМ: BD-5.1–BD-5.3);
  • довести сквозной проект от SLA-контракта до работающего shared ИИ-сервиса на 30 пользователей.

Структура и содержание. Дисциплина состоит из 8 модулей:

  • Архитектура и эксплуатационные требования к промышленным ИИ-системам
  • Контейнеризация и серверы инференса моделей МО
  • Оркестрация и масштабирование ИИ-сервисов
  • Инфраструктура данных и RAG-контуры
  • CI/CD, реестры моделей и GitOps
  • Мониторинг, логирование и наблюдаемость
  • Нагрузочное тестирование, устойчивость и оценка качества
  • Планирование мощности, разнородная инфраструктура и итоговый проект Обучение включает лекции, лабораторные работы, проект, самостоятельную работу и завершается зачетом.

Пререквизиты и связи с другими дисциплинами.

Код Дисциплина Сем. Что даёт для курса
Б1.О.23 Администрирование информационных сетей 3 TCP/IP, HTTP, DNS, TLS, балансировка — база для serving и мониторинга
Б1.О.31 Операционные системы 3 Linux, процессы, systemd, права, CLI — среда развертывания
Б1.О.35 Обработка данных на Python 3 Python как язык интеграции и скриптов инфры
Б1.О.20 Базы данных 4 SQL, PostgreSQL, транзакции, индексы — data-слой
Б1.О.21 WEB-разработка 4 REST API — интерфейс инференс-сервисов
Б1.О.28 Технологии управления данными NoSQL 5 NoSQL, кэши — Redis, векторные БД
Б1.В.18 Технологии создания и поддержки ПО 4–5 Жизненный цикл ПО, основы CI/CD
Б1.В.12 Машинное обучение 5 Что такое модель, инференс, метрики качества
Б1.В.16 Нейросетевые технологии 5 Архитектуры нейросетей, пайплайн обучения
Б1.В.10 Глубокое обучение 6 DL-модели, которые предстоит сервить (LLM и др.)
Б1.О.29 MLOps & DevOps 6 Docker, CI/CD, основы K8s — прямой предшественник
Б1.О.30 Микросервисная архитектура 6 Декомпозиция сервисов, оркестрация
Б1.О.39 Технологии тестирования ПО 6 База для k6/Locust, нагрузочного тестирования, SLA
Б1.О.40 Технологии обработки больших данных 6 Spark/Flink, дата-инфраструктура

Планируемые результаты обучения.

По завершении дисциплины обучающийся сможет:

  1. развернуть модель МО в production-окружении — собрать контейнерный образ модели и запустить inference-сервер (vLLM/Triton) на CPU и GPU, измерив базовые метрики latency/throughput (LC-5.1, BD-5.2; проверяется в ЛР2);
  2. оркестрировать и масштабировать ИИ-сервис в Kubernetes — развернуть сервис на GPU-ноде, настроить автомасштабирование (HPA), secrets и rolling update (LC-5.1; ЛР3);
  3. построить инфраструктуру данных и RAG-контур с разграничением доступа — развернуть S3-хранилище, векторную БД и кэш, спроектировать контуры read-only/read-write и схему доступа (LC-5.2; ЛР4);
  4. автоматизировать поставку модели — настроить CI/CD-пайплайн «сборка образа → registry → GitOps-деплой в Kubernetes» (LC-5.1; ЛР5);
  5. обеспечить наблюдаемость и подтвердить эксплуатационное качество — инструментировать сервис, собрать метрики инференса (TTFT, TPS, GPU util) в Prometheus/Grafana, провести нагрузочные и chaos-тесты профиля «30 пользователей» (LC-5.1, BD-5.3; ЛР6–ЛР7);
  6. сформулировать и доказать SLA shared ИИ-сервиса на 30 пользователей — выполнить capacity planning, обосновать выбор инфраструктурного стека и подтвердить SLO данными нагрузочных тестов при защите итогового проекта (BD-5.1–BD-5.3; ЛР8).

Полное описание приведено в РПД.

2. Модель измерения

Уровни сформированности индикаторов — по КРМ (версия 3.0): Б (базовый), С (средний), П (продвинутый).

Модуль / элемент Код и название компетенции Индикатор Уровень Дескриптор освоения Форма контроля КИМ Ресурсы
1 Модуль 1. Архитектура и эксплуатационные требования к промышленным ИИ-системам LC-5 Промышленная разработка, развертывание, эксплуатация и мониторинг систем ИИ; BD-5 Дополнительные технологии организации инфраструктуры больших данных LC-5.1, BD-5.3 Б Формулирует эксплуатационные требования и SLO/SLA для ИИ-сервиса на 30 пользователей (p95, TTFT, TPS, availability) Текущая ЛР1, экспресс-тест ресурсы
2 Модуль 2. Контейнеризация и серверы инференса моделей МО LC-5; BD-5 LC-5.1, BD-5.2 Б–С Собирает контейнерный образ модели, запускает inference-сервер (vLLM/Triton) на CPU и GPU, измеряет базовые метрики latency/throughput Текущая ЛР2, экспресс-тест ресурсы
3 Модуль 3. Оркестрация и масштабирование ИИ-сервисов LC-5 LC-5.1 С Разворачивает и масштабирует inference-сервис в Kubernetes: GPU-ноды, HPA, secrets, rolling update Текущая ЛР3, экспресс-тест ресурсы
Рубеж 1: этапы проекта «Сервис-контракт и контейнер», «Оркестрация» LC-5 LC-5.1 С Способен довести сервис от SLA-контракта до работающего развёртывания в Kubernetes Рубежная Контрольная точка проекта
4 Модуль 4. Инфраструктура данных и RAG-контуры LC-5; BD-5 LC-5.2, BD-5.1 С Собирает data/RAG-контур (S3-хранилище, векторная БД, кэш), проектирует схему доступа read-only/read-write Текущая ЛР4, экспресс-тест ресурсы
5 Модуль 5. CI/CD, реестры моделей и GitOps LC-5 LC-5.1 С Строит пайплайн поставки модели: сборка образа → registry → GitOps-деплой в Kubernetes Текущая ЛР5, экспресс-тест ресурсы
6 Модуль 6. Мониторинг, логирование и наблюдаемость LC-5; BD-5 LC-5.1, BD-5.3 С Инструментирует сервис, собирает метрики инференса (TTFT, TPS, GPU util), настраивает дашборды и алерты Текущая ЛР6, экспресс-тест ресурсы
7 Модуль 7. Нагрузочное тестирование, устойчивость и оценка качества BD-5 BD-5.3 С–П Проводит нагрузочные, A/B и chaos-тесты профиля «30 пользователей»; принимает решения об оптимизации на основе данных Текущая ЛР7, peer-review ресурсы
Рубеж 2: этап проекта «Данные/RAG и поставка» LC-5; BD-5 LC-5.2, BD-5.1 С Способен обеспечить сервис данными и автоматической поставкой Рубежная Контрольная точка проекта
8 Модуль 8. Планирование мощности, разнородная инфраструктура и итоговый проект BD-5 BD-5.2, BD-5.3 П Планирует мощности, обосновывает выбор инфраструктуры, доказывает SLA данными нагрузочных тестов Текущая ЛР8 ресурсы
Дифференцированный зачёт LC-5; BD-5 LC-5.1–5.2, BD-5.1–5.3 П Защищает итоговый shared ИИ-сервис на 30 пользователей: MVP + документация + SLA-отчёт Промежуточная Защита проекта перед комиссией

3. Контрольно-измерительные материалы

Каждый КИМ должен содержать назначение, проверяемые результаты, условия выполнения, материалы задания, формат сдачи, критерии и шкалу оценивания, правила использования внешних ресурсов и генеративного ИИ.

4. Итоговая оценка

Итоговая оценка формируется как сумма баллов по критериям (максимум 100):

Критерий Описание Оценочное средство Вес, %
Посещение Отметка о наличии на лекциях и практических занятиях 0
Промежуточное тестирование Экспресс-тесты в начале лекции по пройденному материалу ЛР-тесты модулей 15
Лабораторные работы Сдача лабораторных работ ЛР1–ЛР7 по модулям КИМ модулей M1–M7 30
Peer-review Рецензирование работ сокурсников: участие + качество рецензий Регламент peer-review 10
Командный проект Подготовка и защита командного проекта (2 оси: «Программное решение» и «Документация») Проектная работа 20
Зачёт Устный ответ на вопросы по дисциплине с примерами; практическое задание с оценкой существующих решений Зачёт 25
Итого 100

Дисциплина считается освоенной при наборе не менее 70 баллов и получении не менее 4 из 10 баллов по каждой оси командного проекта («Программное решение», «Документация»). Перевод результата в принятую в образовательной организации шкалу оценок выполняется в соответствии с локальными нормативными актами.

Каждое оценочное средство использует единую 10-балльную рубрику с опорными точками уровней КРМ (4 — Б, 6 — С, 8 — С–П, 10 — П); соответствие 10-балльной шкалы весам в 100 баллов выполняется пропорционально. Триангуляция обеспечена: каждый индикатор КРМ проверяется не менее чем двумя средствами (см. модель измерения).

5. Методические материалы

6. Структура репозитория

.
├── README.md
├── LICENSE
├── CONTRIBUTING.md
├── TODO.md
├── labs.md
├── docs/
├── M1-Hardware architecture of AI/
├── M2-Containerd and inference/
├── M3-Orchestration and scaling/
├── M4-Data infrastructure/
├── M5-CICD-gitOps/
├── M6-Monitoring/
├── M7-Load testing and quality assessment/
├── M8-Infrastructure planning/
├── Project/
├── Credit/
├── methodical-guidelines/
├── resources/
├── data/
├── team/
└── other/

Подробное дерево приведено в файле repository-tree.txt.

7. Порядок заполнения

  1. Заполните РПД и сформулируйте проверяемые результаты обучения.
  2. Выберите релевантные профессиональные роли и компетенции КРМ.
  3. Для каждого результата выберите индикатор и требуемый уровень.
  4. Заполните модель измерения.
  5. Создайте КИМ и рубрики оценивания по шаблонам.
  6. Согласуйте систему итогового балла.
  7. Добавьте ресурсы, сведения о команде и лицензию.

8. Команда

Сведения об авторах, ролях и вкладе участников размещаются в разделе «Команда проекта». Рекомендуется, чтобы участники добавляли материалы через собственные GitHub-аккаунты: история коммитов будет отражать их вклад.

9. Лицензия

Предлагаемая лицензия для открытых образовательных материалов — Creative Commons Attribution 4.0 International (CC BY 4.0). Перед публикацией согласуйте выбор лицензии с правообладателем; текст лицензии — в файле LICENSE.


About

Deployment, and maintenance of AI systems for ITMO cource

Resources

Contributing

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors