はじめに
強化学習 (RL) は機械学習の 3 番目のパラダイムです。エージェントは、累積報酬を最大化するために環境内でどのように行動するかを学習します。
1. RL vs 監視あり vs 監視なし
| パラダイム | データ | フィードバック | 例 |
|---|---|---|---|
| 監修 | (x, y) ペア | ラベル | 画像分類 |
| 監督なし | x のみ | なし | クラスタリング |
| RL | 状態、アクション | 報酬 (遅延) | ゲームプレイ |
RL のユニークな特性
- 連続的な意思決定: 将来に影響を与える決定
- 報酬の遅延: アクションが良いか悪いかすぐにはわかりません
- 探索 vs 活用: 新しいことを試す vs 既知の知識を活用する
- スーパーバイザーなし: 報酬シグナルのみ
2. エージェントと環境の対話ループ
すべての RL 問題はループの後に続きます。
Agent quan sát state s_t
→ Chọn action a_t theo policy π
→ Environment trả về reward r_{t+1} và state mới s_{t+1}
→ Lặp lại
例: ロボットが迷路を通過する
import gymnasium as gym
env = gym.make("FrozenLake-v1", render_mode="human")
state, info = env.reset()
for step in range(100):
action = env.action_space.sample() # Random policy
next_state, reward, terminated, truncated, info = env.step(action)
print(f"State: {state}, Action: {action}, Reward: {reward}")
if terminated or truncated:
state, info = env.reset()
else:
state = next_state
3. 中心となる概念
州
環境の現在の状態を完全に説明します。
アクション (a)
離散 (左/右) または連続 (回転角度) のどちらのエージェントを実行するかを決定します。
報酬 (r)
環境からのスカラー応答 — エージェントは総報酬を最大化したいと考えています。
ポリシー (π)
状態→アクションのマッピング戦略:
- 決定論的: π(s) = a
- 確率的: π(a|s) = P(a|s)
値関数 V(s)
状態 s から開始した場合に期待される累積報酬:
$$V^\pi(s) = \mathbb{E}\pi\left[\sum{t=0}^{\infty} \gamma^t r_{t+1} | s_0 = s\right]$$
Q関数 Q(s,a)
状態 s でアクション a を選択した場合に期待される累積報酬:
$$Q^\pi(s,a) = \mathbb{E}\pi\left[\sum{t=0}^{\infty} \gamma^t r_{t+1} | s_0 = s、a_0 = a\right]$$
4. マルコフ決定プロセス (MDP)
MDP は RL の標準的な数学的フレームワークです: (S, A, P, R, γ)
| 成分 | 記号 | 説明 |
|---|---|---|
| 州 | S | すべての状態のコレクション |
| アクション | あ | すべてのアクションのコレクション |
| 移行 | P(s' | s,a) |
| 報酬 | R(s,a,s') | 報酬関数 |
| 割引 | γ ∈ [0,1] | 割引率 |
マルコフ特性: 未来は現在のみに依存し、過去には依存しません。
5. 探索 vs 搾取
| 戦略 | 説明 | トレードオフ |
|---|---|---|
| 探検 | 新しいアクションを試す | より良い戦略を見つける |
| 搾取 | 最もよく知られているアクションを使用します | 短期的な報酬を最大化する |
バランス調整方法:
- ε-greedy: 確率 ε でランダム
- UCB: 信頼限界の上限
- トンプソン サンプリング: ベイジアン アプローチ
概要
| コンセプト | 説明 |
|---|---|
| RL | エージェントは環境とのインタラクションから学習します |
| MDP | 数学のフレームワーク: 状態、アクション、報酬 |
| ポリシー | アクション選択戦略 |
| 値 | 予想される累積報酬 |
| 探検 | 新しい試みと活用のバランス |