PyTorchを用いた、強化学習(Reinforcement Learning)の主要アルゴリズムの実装集です。理論の学習と実験を目的として、基本的なモデルフリー手法から最先端のモデルベース・オフライン強化学習まで試しています。
本リポジトリでは、以下の手法を実装・検証しています。
| 分類 | 手法名 | 概要 |
|---|---|---|
| モデルフリー (方策勾配系) | A2C (Advantage Actor-Critic) | 同期型のActor-Criticアルゴリズム |
| PPO (Proximal Policy Optimization) | 安定性と効率性に優れた代表的な方策最適化手法 | |
| モデルフリー (方策オフ型) | SAC (Soft Actor-Critic) | エントロピー正則化を用いた連続値アクション向けアルゴリズム |
| モデルベース | MPC (Model Predictive Control) | 環境モデルを用いたモデル予測制御 |
| MBPO (Model-Based Policy Optimization) | 習得した環境モデルを活用した効率的な方策最適化 | |
| オフライン強化学習 | CQL (Conservative Q-Learning) | 未知の状態-行動ペアの過大評価を防ぐオフライン強化学習手法 |
| ワールドモデル / 系列モデリング | Dreamer | 潜在空間上で環境モデルを学習し計画を行うモデルベース手法 |
| Decision Transformer | 強化学習を条件付き系列生成(シーケンスモデリング)として扱う手法 |
- 言語: Python
- フレームワーク: PyTorch
- 形式: 主にJupyter Notebookを用いており、各アルゴリズムの挙動を視覚的かつステップバイステップで確認できます。