シリーズのご紹介
強化学習: 基本から上級まで は、MDP、Q ラーニング プラットフォームから、LLM アライメントのための PPO、SAC、および RLHF を備えた最新のディープ RL まで、RL の分野全体を習得するのに役立つコースです。
🎯 コースを完了すると、次のことが可能になります:
- RL 理論の深い理解: MDP、ベルマン、政策勾配
- DQN、PPO、SAC を最初から実装する
- ジムと安定したベースラインの使用に熟練している3
- LLM アライメントのための RLHF/DPO を理解する
- ゲーム、ロボット工学、現実世界の問題に対応する RL エージェントを構築する
学習パス
パート 1: RL プラットフォーム
MDP、ダイナミック プログラミング、Q ラーニング — RL の世界への第一歩。
パート 2: 深層強化学習
DQN、ポリシー勾配、PPO、SAC — ニューラル ネットワークが RL に遭遇したとき。
パート 3: フレームワークと実践
体育館、Stable-Baselines3、ロボット工学シミュレーション。
パート 4: RLHF とプロダクション
LLM 調整、マルチエージェント、実稼働展開用の RL。