Chuyển đến nội dung chính

強化學習:從基礎到高級

全面的密集學習課程-從 MDP、Q-Learning 到具有 DQN、策略梯度、PPO、SAC 的深度 RL 平台。練習遊戲 AI、機器人模擬、LLM 的 RLHF,並使用 Python、Gymnasium、Stable-Baselines3 部署可用於生產的 RL 代理程式。

系列介紹

強化學習:從基礎知識到高級是一門幫助您掌握 RL 整個領域的課程 - 從 MDP、Q-Learning 平台到使用 PPO、SAC 和 RLHF 進行 LLM 調整的現代深度 RL。

🎯 完成課程後,您將:

  • 深入理解RL理論:MDP、Bellman、Policy Gradient
  • 從頭開始實施DQN、PPO、SAC
  • 熟練使用體育館和穩定基線3
  • 了解 RLHF/DPO 以實現 LLM 對齊
  • 為遊戲、機器人和現實問題建立強化學習代理

學習路徑

第 1 部分:強化學習平台

MDP、動態規劃、Q-Learning——您進入 RL 世界的第一步。

第 2 部分:深度強化學習

DQN、策略梯度、PPO、SAC——當神經網路遇到 RL 時。

第 3 部分:框架與實踐

體育館、穩定基準3、機器人模擬。

第 4 部分:RLHF 和製作

用於 LLM 對齊、多代理程式和生產部署的 RL。