연락처 정보

코스 개요

1. 딥 리인포스먼트 러닝 개요

  • 강화학습이란?
  • 지도학습, 비지도학습, 강화학습의 차이
  • 2025년 DRL의 응용 분야 (로봇공학, 헬스케어, 금융, 물류)
  • 에이전트-환경 상호작용 루프 이해

2. 강화학습 기초

  • 마르코프 의사결정 과정 (MDP)
  • 상태, 행동, 보상, 정책, 가치 함수
  • 탐색(Exploration)과 수확(Exploitation)의 트레이드오프
  • 몬테카를로 방법과 시간차(Temporal-Difference, TD) 학습

3. 기본 RL 알고리즘 구현

  • 테이블 기반 방법: 동적 프로그래밍, 정책 평가, 반복
  • Q-Learning과 SARSA
  • 에프실론-그리디(epsilon-greedy) 탐색 및 감쇠 전략
  • OpenAI Gymnasium으로 RL 환경 구현

4. 딥 리인포스먼트 러닝으로의 전환

  • 테이블 기반 방법의 한계
  • 함수 근사화를 위한 신경망 활용
  • Deep Q-Network (DQN) 아키텍처 및 워크플로우
  • 경험 리플레이(Experience replay) 및 타겟 네트워크(Target networks)

5. 고급 DRL 알고리즘

  • Double DQN, Dueling DQN, 우선순위 경험 리플레이(Prioritized Experience Replay)
  • 정책 기울기(Policy Gradient) 방법: REINFORCE 알고리즘
  • Actor-Critic 아키텍처 (A2C, A3C)
  • 근접 정책 최적화(PPO, Proximal Policy Optimization)
  • 소프트 액터-크리틱(SAC, Soft Actor-Critic)

6. 연속적 행동 공간 다루기

  • 연속 제어의 과제
  • DDPG(Deep Deterministic Policy Gradient) 사용
  • Twin Delayed DDPG (TD3)

7. 실용적 도구 및 프레임워크

  • Stable-Baselines3와 Ray RLlib 활용
  • TensorBoard를 이용한 로깅 및 모니터링
  • DRL 모델 하이퍼파라미터 튜닝

8. 보상 엔지니어링 및 환경 설계

  • 보상 성형(Reward shaping) 및 패널티 균형 조정
  • 시뮬레이션에서 실제 환경으로의 이관 학습(Sim-to-real transfer learning) 개념
  • Gymnasium에서 커스텀 환경 생성

9. 부분적으로 관찰 가능한 환경 및 일반화

  • 불완전한 상태 정보 처리 (POMDPs)
  • LSTM과 RNN을 활용한 메모리 기반 접근법
  • 에이전트 강건성 및 일반화 향상

10. 게임 이론과 멀티 에이전트 강화학습

  • 멀티 에이전트 환경 입문
  • 협력과 경쟁
  • 적대적 훈련 및 전략 최적화에 대한 응용

11. 사례 연구 및 실제 응용

  • 자율주행 시뮬레이션
  • 동적 가격 책정 및 금융 트레이딩 전략
  • 로봇공학 및 산업 자동화

12. 문제 해결 및 최적화

  • 불안정한 훈련 진단
  • 보상 희소성 및 과적합 관리
  • GPU 및 분산 시스템에서 DRL 모델 스케일링

13. 요약 및 다음 단계

  • DRL 아키텍처 및 핵심 알고리즘 복습
  • 산업 동향 및 연구 방향 (예: RLHF, 하이브리드 모델)
  • 추가 자료 및 참고 문헌

요건

  • 파이썬 프로그래밍 숙련도
  • 미적분학 및 선형대수학 이해
  • 확률론 및 통계학 기초 지식
  • Python과 NumPy 또는 TensorFlow/PyTorch를 사용하여 머신러닝 모델 구축 경험

대상 독자

  • AI 및 지능형 시스템에 관심 있는 개발자
  • 강화학습 프레임워크를 탐색하는 데이터 사이언티스트
  • 자율 시스템과 관련된 업무를 수행하는 머신러닝 엔지니어
 21 시간

참가자 수


참가자별 가격

회원 평가 (3)

예정된 코스

관련 카테고리