Zkuste nás kontaktovat

Návrh Školení

1. Úvod do hlubokého učení s posilováním

  • Co je učení s posilováním?
  • Rozdíly mezi dohledovaným, nedohledovaným a učním s posilováním
  • Aplikace DRL v roce 2025 (robotika, zdravotnictví, finance, logistika)
  • Pochopení interakčního cyklu mezi agentem a prostředím

2. Základy učení s posilováním

  • Markovovy rozhodovací procesy (MDP)
  • Stav, akce, odměna, politika a hodnotové funkce
  • Obchodování mezi prozkoumáním a využíváním (exploration vs. exploitation)
  • Monte Carlo metody a učení rozdílů časových úseků (TD learning)

3. Implementace základních algoritmů RL

  • Tabulární metody: dynamické programování, vyhodnocení politiky a iterace
  • Q-Learning a SARSA
  • Epsilon-greedy prozkoumávání a strategie s klesajícímepsilon
  • Implementace prostředí pro RL pomocí OpenAI Gymnasium

4. Přechod k hlubokému učení s posilováním

  • Omezení tabulárních metod
  • Použití neuronových sítí pro aproximaci funkcí
  • Architektura a workflow Deep Q-Network (DQN)
  • Reprodukce zkušeností (experience replay) a cílové sítě

5. Pokročilé algoritmy DRL

  • Double DQN, Dueling DQN a Prioritized Experience Replay
  • Metody gradientů politiky: algoritmus REINFORCE
  • Architektury Actor-Critic (A2C, A3C)
  • Proximal Policy Optimization (PPO)
  • Soft Actor-Critic (SAC)

6. Práce s kontinuálním prostorem akcí

  • Výzvy v oblasti kontinuálního řízení
  • Použití DDPG (Deep Deterministic Policy Gradient)
  • Twin Delayed DDPG (TD3)

7. Praktické nástroje a rámce

  • Použití Stable-Baselines3 a Ray RLlib
  • Logování a monitorování pomocí TensorBoard
  • Ladění hyperparametrů pro modely DRL

8. Inženýrství odměn a design prostředí

  • Tvarování odměn (reward shaping) a vyvážení penalizací
  • Koncepty přenosu ze simulace do reálného světa (sim-to-real)
  • Vytváření vlastních prostředí v Gymnasium

9. Částečně pozorovatelná prostředí a generalizace

  • Práce s neúplnými informacemi o stavu (POMDPs)
  • Přístupy založené na paměti pomocí LSTMs a RNNs
  • Zlepšování robustnosti agentů a generalizace

10. Hra teorií a učení s posilováním více agentů

  • Úvod do prostředí více agentů
  • Spolupráce vs. konkurence
  • Aplikace v adversariálním tréninku a optimalizaci strategií

11. Případové studie a reálné aplikace

  • Simulace samojízdy
  • Dynamické stanovení cen a finanční obchodní strategie
  • Robotika a průmyslová automatizace

12. Řešení problémů a optimalizace

  • Diagnostikování nestabilního tréninku
  • Řízení řídkosti odměn a přeučení (overfitting)
  • Měření škálovatelnosti modelů DRL na GPU a distribuovaných systémech

13. Shrnutí a další kroky

  • Shrnutí architektury DRL a klíčových algoritmů
  • Trendy v oboru a směry výzkumu (např. RLHF, hybridní modely)
  • Další zdroje a čtení

Požadavky

  • Znalost programování v Pythonu
  • Pochopení kalkulu a lineární algebry
  • Základní znalosti teorie pravděpodobnosti a statistiky
  • Zkušenosti s vytvářením modelů strojového učení pomocí Pythonu a NumPy nebo TensorFlow/PyTorch

Cílová skupina

  • Vývojáři zajímající se o umělou inteligenci a inteligentní systémy
  • Data vědci zkoumající rámce pro učení s posilováním
  • Inženýři strojového učení pracující s autonomními systémy
 21 Hodiny

Počet účastníků


Cena za účastníka

Reference (3)

Nadcházející kurzy

Související kategorie