Intrati in legatura

Schița de curs

1. Introducere în Deep Reinforcement Learning

  • Ce este Reinforcement Learning?
  • Diferența dintre învățarea supervizată, nesupervizată și prin consolidare
  • Aplicații ale DRL în 2025 (robotică, sănătate, finanțe, logistică)
  • Înțelegerea buclei de interacțiune agent-mediu

2. Fundamentele învățării prin consolidare

  • Procese de decizie Markov (MDP)
  • Funcții de stare, acțiune, recompensă, politică și valoare
  • Compromisul dintre explorare și exploatare
  • Metode Monte Carlo și învățare Temporal-Difference (TD)

3. Implementarea algoritmilor de bază de RL

  • Metode tabulare: programare dinamică, evaluarea politicilor și iterație
  • Q-Learning și SARSA
  • Explorare epsilon-greedy și strategii de descreștere
  • Implementarea mediilor de RL cu OpenAI Gymnasium

4. Tranziția către Deep Reinforcement Learning

  • Limitările metodelor tabulare
  • Folosirea rețelelor neuronale pentru aproximarea funcțiilor
  • Arhitectura și fluxul de lucru Deep Q-Network (DQN)
  • Experience replay și rețele țintă

5. Algoritmi avansați de DRL

  • Double DQN, Dueling DQN și Prioritized Experience Replay
  • Metode Policy Gradient: algoritmul REINFORCE
  • Arhitecturi Actor-Critic (A2C, A3C)
  • Proximal Policy Optimization (PPO)
  • Soft Actor-Critic (SAC)

6. Lucrul cu spații de acțiuni continue

  • Provocări în controlul continuu
  • Folosirea DDPG (Deep Deterministic Policy Gradient)
  • Twin Delayed DDPG (TD3)

7. Instrumente și framework-uri practice

  • Folosirea Stable-Baselines3 și Ray RLlib
  • Logging și monitorizare cu TensorBoard
  • Reglarea hiperparametrilor pentru modelele DRL

8. Reward Engineering și designul mediului

  • Reward shaping și echilibrarea penalizărilor
  • Concepte de transfer learning sim-to-real
  • Crearea de medii personalizate în Gymnasium

9. Medii parțial observabile și generalizare

  • Gestionarea informațiilor incomplete de stare (POMDP-uri)
  • Abordări bazate pe memorie folosind LSTM-uri și RNN-uri
  • Îmbunătățirea robusteții și generalizării agentului

10. Teoria jocurilor și învățarea prin consolidare multi-agent

  • Introducere în medii multi-agent
  • Cooperare vs. competiție
  • Aplicații în antrenarea adversarială și optimizarea strategiilor

11. Studii de caz și aplicații din lumea reală

  • Simulări de conducere autonomă
  • Strategii de prețuri dinamice și tranzacționare financiară
  • Robotică și automatizare industrială

12. Depanare și optimizare

  • Diagnosticarea antrenării instabile
  • Gestionarea rarității recompenselor și a overfitting-ului
  • Scalarea modelelor DRL pe GPU-uri și sisteme distribuite

13. Rezumat și pașii următori

  • Recapitularea arhitecturii DRL și a algoritmilor cheie
  • Tendințe în industrie și direcții de cercetare (de exemplu, RLHF, modele hibride)
  • Resurse suplimentare și materiale de lectură

Cerințe

  • Competențe solide în programarea Python
  • Înțelegerea calculului diferențial și a algebrei liniare
  • Cunoștințe de bază de probabilități și statistică
  • Experiență în construirea modelelor de machine learning folosind Python și NumPy sau TensorFlow/PyTorch

Audiență

  • Dezvoltatori interesați de AI și sisteme inteligente
  • Data scientists care explorează framework-uri de reinforcement learning
  • Ingineri de machine learning care lucrează cu sisteme autonome
 21 Ore

Numărul de participanți


Pret per participant

Mărturii (3)

Cursuri viitoare

Categorii înrudite