Giới thiệu Series
Reinforcement Learning: Từ Cơ bản đến Nâng cao là khóa học giúp bạn nắm vững toàn bộ lĩnh vực RL — từ nền tảng MDP, Q-Learning đến Deep RL hiện đại với PPO, SAC, và RLHF cho LLM Alignment.
🎯 Sau khi hoàn thành khóa học, bạn sẽ:
- Hiểu sâu lý thuyết RL: MDP, Bellman, Policy Gradient
- Implement DQN, PPO, SAC từ scratch
- Sử dụng thành thạo Gymnasium & Stable-Baselines3
- Hiểu RLHF/DPO cho LLM alignment
- Xây dựng RL agent cho game, robotics, và real-world problems
Lộ trình học
Phần 1: Nền tảng RL
MDP, Dynamic Programming, Q-Learning — bước đầu vào thế giới RL.
Phần 2: Deep Reinforcement Learning
DQN, Policy Gradient, PPO, SAC — khi neural networks gặp RL.
Phần 3: Frameworks & Thực hành
Gymnasium, Stable-Baselines3, robotics simulation.
Phần 4: RLHF & Production
RL cho LLM alignment, multi-agent, và deploy production.
