Chuyển đến nội dung chính

強化学習: 基礎から高度まで

包括的な強化学習コース — MDP、Q ラーニングから DQN、ポリシー勾配、PPO、SAC を備えたディープ RL プラットフォームまで。ゲーム AI、ロボティクス シミュレーション、LLM 用 RLHF を練習し、Python、Gymnasium、Stable-Baselines3 を使用して本番環境に対応した RL エージェントを展開します。

シリーズのご紹介

強化学習: 基本から上級まで は、MDP、Q ラーニング プラットフォームから、LLM アライメントのための PPO、SAC、および RLHF を備えた最新のディープ RL まで、RL の分野全体を習得するのに役立つコースです。

🎯 コースを完了すると、次のことが可能になります:

  • RL 理論の深い理解: MDP、ベルマン、政策勾配
  • DQN、PPO、SAC を最初から実装する
  • ジムと安定したベースラインの使用に熟練している3
  • LLM アライメントのための RLHF/DPO を理解する
  • ゲーム、ロボット工学、現実世界の問題に対応する RL エージェントを構築する

学習パス

パート 1: RL プラットフォーム

MDP、ダイナミック プログラミング、Q ラーニング — RL の世界への第一歩。

パート 2: 深層強化学習

DQN、ポリシー勾配、PPO、SAC — ニューラル ネットワークが RL に遭遇したとき。

パート 3: フレームワークと実践

体育館、Stable-Baselines3、ロボット工学シミュレーション。

パート 4: RLHF とプロダクション

LLM 調整、マルチエージェント、実稼働展開用の RL。

パート 1: RL の基礎 — マルコフの意思決定プロセスと表形式の手法

パート 2: 深層強化学習 — ニューラル ネットワークと RL の出会い

パート 3: RL フレームワークと実践

パート 4: RLHF、LLM の調整と生産