系列介紹
強化學習:從基礎知識到高級是一門幫助您掌握 RL 整個領域的課程 - 從 MDP、Q-Learning 平台到使用 PPO、SAC 和 RLHF 進行 LLM 調整的現代深度 RL。
🎯 完成課程後,您將:
- 深入理解RL理論:MDP、Bellman、Policy Gradient
- 從頭開始實施DQN、PPO、SAC
- 熟練使用體育館和穩定基線3
- 了解 RLHF/DPO 以實現 LLM 對齊
- 為遊戲、機器人和現實問題建立強化學習代理
學習路徑
第 1 部分:強化學習平台
MDP、動態規劃、Q-Learning——您進入 RL 世界的第一步。
第 2 部分:深度強化學習
DQN、策略梯度、PPO、SAC——當神經網路遇到 RL 時。
第 3 部分:框架與實踐
體育館、穩定基準3、機器人模擬。
第 4 部分:RLHF 和製作
用於 LLM 對齊、多代理程式和生產部署的 RL。