Schița de curs
1. Introducere în Deep Reinforcement Learning
- Ce este Reinforcement Learning?
- Diferența dintre învățarea supervizată, nesupervizată și prin consolidare
- Aplicații ale DRL în 2025 (robotică, sănătate, finanțe, logistică)
- Înțelegerea buclei de interacțiune agent-mediu
2. Fundamentele învățării prin consolidare
- Procese de decizie Markov (MDP)
- Funcții de stare, acțiune, recompensă, politică și valoare
- Compromisul dintre explorare și exploatare
- Metode Monte Carlo și învățare Temporal-Difference (TD)
3. Implementarea algoritmilor de bază de RL
- Metode tabulare: programare dinamică, evaluarea politicilor și iterație
- Q-Learning și SARSA
- Explorare epsilon-greedy și strategii de descreștere
- Implementarea mediilor de RL cu OpenAI Gymnasium
4. Tranziția către Deep Reinforcement Learning
- Limitările metodelor tabulare
- Folosirea rețelelor neuronale pentru aproximarea funcțiilor
- Arhitectura și fluxul de lucru Deep Q-Network (DQN)
- Experience replay și rețele țintă
5. Algoritmi avansați de DRL
- Double DQN, Dueling DQN și Prioritized Experience Replay
- Metode Policy Gradient: algoritmul REINFORCE
- Arhitecturi Actor-Critic (A2C, A3C)
- Proximal Policy Optimization (PPO)
- Soft Actor-Critic (SAC)
6. Lucrul cu spații de acțiuni continue
- Provocări în controlul continuu
- Folosirea DDPG (Deep Deterministic Policy Gradient)
- Twin Delayed DDPG (TD3)
7. Instrumente și framework-uri practice
- Folosirea Stable-Baselines3 și Ray RLlib
- Logging și monitorizare cu TensorBoard
- Reglarea hiperparametrilor pentru modelele DRL
8. Reward Engineering și designul mediului
- Reward shaping și echilibrarea penalizărilor
- Concepte de transfer learning sim-to-real
- Crearea de medii personalizate în Gymnasium
9. Medii parțial observabile și generalizare
- Gestionarea informațiilor incomplete de stare (POMDP-uri)
- Abordări bazate pe memorie folosind LSTM-uri și RNN-uri
- Îmbunătățirea robusteții și generalizării agentului
10. Teoria jocurilor și învățarea prin consolidare multi-agent
- Introducere în medii multi-agent
- Cooperare vs. competiție
- Aplicații în antrenarea adversarială și optimizarea strategiilor
11. Studii de caz și aplicații din lumea reală
- Simulări de conducere autonomă
- Strategii de prețuri dinamice și tranzacționare financiară
- Robotică și automatizare industrială
12. Depanare și optimizare
- Diagnosticarea antrenării instabile
- Gestionarea rarității recompenselor și a overfitting-ului
- Scalarea modelelor DRL pe GPU-uri și sisteme distribuite
13. Rezumat și pașii următori
- Recapitularea arhitecturii DRL și a algoritmilor cheie
- Tendințe în industrie și direcții de cercetare (de exemplu, RLHF, modele hibride)
- Resurse suplimentare și materiale de lectură
Cerințe
- Competențe solide în programarea Python
- Înțelegerea calculului diferențial și a algebrei liniare
- Cunoștințe de bază de probabilități și statistică
- Experiență în construirea modelelor de machine learning folosind Python și NumPy sau TensorFlow/PyTorch
Audiență
- Dezvoltatori interesați de AI și sisteme inteligente
- Data scientists care explorează framework-uri de reinforcement learning
- Ingineri de machine learning care lucrează cu sisteme autonome
Mărturii (3)
Mi-a plăcut foarte mult finalul unde am avut ocazia să jucăm cu CHAT GPT. Sala nu era configuraționată cel mai bine pentru aceasta - ar fi fost mai util să avem câteva mese mici în loc de o masă mare, astfel încât să putem forma grupuri mai mici și să ne brainstorm-urim idei.
Nola - Laramie County Community College
Curs - Artificial Intelligence (AI) Overview
Tradus de catre o masina
Lucrând pe baza principiilor de bază într-un mod concentrat, și trecerea la aplicarea studiilor de caz în aceeași zi
Maggie Webb - Department of Jobs, Regions, and Precincts
Curs - Artificial Neural Networks, Machine Learning, Deep Thinking
Tradus de catre o masina
Faptul că s-a folosit date reale ale unei companii. Formatorul a avut o abordare foarte bună, încurajând participanții să colaboreze și să concureze
Jimena Esquivel - Zaklad Uslugowy Hakoman Andrzej Cybulski
Curs - Applied AI from Scratch in Python
Tradus de catre o masina