Skip to content

Latest commit

 

History

56 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

Pytorchで自学自習で実装した強化学習ユースケース集

PyTorchを用いた、強化学習(Reinforcement Learning)の主要アルゴリズムの実装集です。理論の学習と実験を目的として、基本的なモデルフリー手法から最先端のモデルベース・オフライン強化学習まで試しています。


🚀 収録アルゴリズム・手法

本リポジトリでは、以下の手法を実装・検証しています。

分類 手法名 概要
モデルフリー (方策勾配系) A2C (Advantage Actor-Critic) 同期型のActor-Criticアルゴリズム
PPO (Proximal Policy Optimization) 安定性と効率性に優れた代表的な方策最適化手法
モデルフリー (方策オフ型) SAC (Soft Actor-Critic) エントロピー正則化を用いた連続値アクション向けアルゴリズム
モデルベース MPC (Model Predictive Control) 環境モデルを用いたモデル予測制御
MBPO (Model-Based Policy Optimization) 習得した環境モデルを活用した効率的な方策最適化
オフライン強化学習 CQL (Conservative Q-Learning) 未知の状態-行動ペアの過大評価を防ぐオフライン強化学習手法
ワールドモデル / 系列モデリング Dreamer 潜在空間上で環境モデルを学習し計画を行うモデルベース手法
Decision Transformer 強化学習を条件付き系列生成(シーケンスモデリング)として扱う手法

💻 実行環境・構成

  • 言語: Python
  • フレームワーク: PyTorch
  • 形式: 主にJupyter Notebookを用いており、各アルゴリズムの挙動を視覚的かつステップバイステップで確認できます。

About

Pytorchを用いた強化学習のユースケース集(モデルフリー、モデルベース、オンライン学習、オフライン学習、世界モデル)

Topics

Resources

Stars

0 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages