Návrh Školení
1. Úvod do hlubokého učení s posilováním
- Co je učení s posilováním?
- Rozdíly mezi dohledovaným, nedohledovaným a učním s posilováním
- Aplikace DRL v roce 2025 (robotika, zdravotnictví, finance, logistika)
- Pochopení interakčního cyklu mezi agentem a prostředím
2. Základy učení s posilováním
- Markovovy rozhodovací procesy (MDP)
- Stav, akce, odměna, politika a hodnotové funkce
- Obchodování mezi prozkoumáním a využíváním (exploration vs. exploitation)
- Monte Carlo metody a učení rozdílů časových úseků (TD learning)
3. Implementace základních algoritmů RL
- Tabulární metody: dynamické programování, vyhodnocení politiky a iterace
- Q-Learning a SARSA
- Epsilon-greedy prozkoumávání a strategie s klesajícímepsilon
- Implementace prostředí pro RL pomocí OpenAI Gymnasium
4. Přechod k hlubokému učení s posilováním
- Omezení tabulárních metod
- Použití neuronových sítí pro aproximaci funkcí
- Architektura a workflow Deep Q-Network (DQN)
- Reprodukce zkušeností (experience replay) a cílové sítě
5. Pokročilé algoritmy DRL
- Double DQN, Dueling DQN a Prioritized Experience Replay
- Metody gradientů politiky: algoritmus REINFORCE
- Architektury Actor-Critic (A2C, A3C)
- Proximal Policy Optimization (PPO)
- Soft Actor-Critic (SAC)
6. Práce s kontinuálním prostorem akcí
- Výzvy v oblasti kontinuálního řízení
- Použití DDPG (Deep Deterministic Policy Gradient)
- Twin Delayed DDPG (TD3)
7. Praktické nástroje a rámce
- Použití Stable-Baselines3 a Ray RLlib
- Logování a monitorování pomocí TensorBoard
- Ladění hyperparametrů pro modely DRL
8. Inženýrství odměn a design prostředí
- Tvarování odměn (reward shaping) a vyvážení penalizací
- Koncepty přenosu ze simulace do reálného světa (sim-to-real)
- Vytváření vlastních prostředí v Gymnasium
9. Částečně pozorovatelná prostředí a generalizace
- Práce s neúplnými informacemi o stavu (POMDPs)
- Přístupy založené na paměti pomocí LSTMs a RNNs
- Zlepšování robustnosti agentů a generalizace
10. Hra teorií a učení s posilováním více agentů
- Úvod do prostředí více agentů
- Spolupráce vs. konkurence
- Aplikace v adversariálním tréninku a optimalizaci strategií
11. Případové studie a reálné aplikace
- Simulace samojízdy
- Dynamické stanovení cen a finanční obchodní strategie
- Robotika a průmyslová automatizace
12. Řešení problémů a optimalizace
- Diagnostikování nestabilního tréninku
- Řízení řídkosti odměn a přeučení (overfitting)
- Měření škálovatelnosti modelů DRL na GPU a distribuovaných systémech
13. Shrnutí a další kroky
- Shrnutí architektury DRL a klíčových algoritmů
- Trendy v oboru a směry výzkumu (např. RLHF, hybridní modely)
- Další zdroje a čtení
Požadavky
- Znalost programování v Pythonu
- Pochopení kalkulu a lineární algebry
- Základní znalosti teorie pravděpodobnosti a statistiky
- Zkušenosti s vytvářením modelů strojového učení pomocí Pythonu a NumPy nebo TensorFlow/PyTorch
Cílová skupina
- Vývojáři zajímající se o umělou inteligenci a inteligentní systémy
- Data vědci zkoumající rámce pro učení s posilováním
- Inženýři strojového učení pracující s autonomními systémy
Reference (3)
Opravdu jsem se líbil konec, kdy jsme si vyzkoušeli CHAT GPT. Místnost nebyla pro toto cvičení nejlepší nastavená - místo jednoho velkého stolu by pomohlo několik menších stolů, abychom se mohli rozdělit do menších skupin a společně přemýšlet.
Nola - Laramie County Community College
Kurz - Artificial Intelligence (AI) Overview
Přeloženo strojem
Práce na základě prvních principů s cíleným zaměřením a následné aplikace případových studií v rámci stejného dne
Maggie Webb - Department of Jobs, Regions, and Precincts
Kurz - Artificial Neural Networks, Machine Learning, Deep Thinking
Přeloženo strojem
Že se používala skutečná společenská data. Trainer měl velmi dobrý přístup tím, že tréninky podporoval účastí a soutěží.
Jimena Esquivel - Zaklad Uslugowy Hakoman Andrzej Cybulski
Kurz - Applied AI from Scratch in Python
Přeloženo strojem