Chuyển đến nội dung chính

第一課:什麼是強化學習? — 代理、環境與獎勵

定義 RL,比較監督/無監督/RL。代理-環境交互循環。狀態、行動、獎勵、策略、價值函數。 MDP。探索與利用。

🧠 人工智慧與機器學習 — 第 0 課 第一課:什麼是強化學習? — 代理、環境和獎勵

強化學習:從基礎到高級

第 1 部分:強化學習基礎 — 馬可夫決策過程與表格方法

亞洲開發網

簡介

強化學習 (RL) 是機器學習的第三個範例 - 代理學習如何在環境中採取行動以最大化累積獎勵。


1. 強化學習 vs 有監督 vs 無監督

範式資料回饋範例
監督(x, y) 對標籤圖像分類
無人監督僅限 x無聚類
RL狀態、行動獎勵(延遲)遊戲玩法

強化學習的獨特特徵

  • 順序決策:影響未來的決策
  • 延遲獎勵:無法立即知道該行為是好還是壞
  • 探索與利用:嘗試新事物與利用已知知識
  • 無監督者:僅獎勵訊號

2. 智能體-環境互動循環

每個強化學習問題都遵循一個循環:

Agent quan sát state s_t
  → Chọn action a_t theo policy π
  → Environment trả về reward r_{t+1} và state mới s_{t+1}
  → Lặp lại

範例:機器人穿越迷宮

import gymnasium as gym

env = gym.make("FrozenLake-v1", render_mode="human")
state, info = env.reset()

for step in range(100):
    action = env.action_space.sample()  # Random policy
    next_state, reward, terminated, truncated, info = env.step(action)
    print(f"State: {state}, Action: {action}, Reward: {reward}")
    
    if terminated or truncated:
        state, info = env.reset()
    else:
        state = next_state

3.核心概念

州

充分描述了環境的當前狀態。

行動(一)

決定執行哪個代理 - 離散(左/右)或連續(旋轉角度)。

獎勵 (r)

來自環境的標量響應-智能體希望最大化總獎勵。

政策 (π)

狀態→動作映射策略:

  • 確定性:π(s) = a
  • 隨機:π(a|s) = P(a|s)

值函數 V(s)

從狀態 s 開始時的期望累積獎勵:

$$V^\pi(s) = \mathbb{E}\pi\left[\sum{t=0}^{\infty} \gamma^t r_{t+1} | s_0 = s\右]$$

Q-函數 Q(s,a)

在狀態 s 選擇動作 a 時的期望累積獎勵:

$$Q^\pi(s,a) = \mathbb{E}\pi\left[\sum{t=0}^{\infty} \gamma^t r_{t+1} | s_0 = s, a_0 = a\右]$$


4.馬可夫決策過程(MDP)

MDP 是 RL 的標準數學架構:(S, A, P, R, γ)

成分符號描述
州S各州合集
行動一個所有動作集合
過渡P(s's,a)
獎勵R(s,a,s')R(s,a,s')
折扣γ ∈ [0,1]折扣係數

馬可夫性質:未來只取決於現在,而不取決於過去。


5. 探索與利用

戰略描述權衡
探索嘗試新動作尋找更好的策略
剝削使用最著名的動作短期回報最大化

平衡方法:

  • ε-貪婪:機率為 ε 的隨機
  • UCB:信賴上限
  • 湯普森採樣:貝葉斯方法

總結

概念描述
RL代理人從與環境的互動中學習
MDP數學架構:狀態、行動、獎勵
政策行動選擇策略
價值預期累計獎勵
探索嘗試新事物與探索之間的平衡