Chuyển đến nội dung chính

レッスン 1: 強化学習とは何ですか? — エージェント、環境、報酬

RL を定義し、教師あり/教師なし/RL を比較します。エージェントと環境の相互作用ループ。状態、アクション、報酬、ポリシー、価値関数。民主党。探索と搾取。

🧠 AI と ML — レッスン 0 レッスン 1: 強化学習とは何ですか? — エージェント、環境、報酬

強化学習: 基礎から高度まで

パート 1: RL の基礎 — マルコフの意思決定プロセスと表形式の手法

xdev.asia

はじめに

強化学習 (RL) は機械学習の 3 番目のパラダイムです。エージェントは、累積報酬を最大化するために環境内でどのように行動するかを学習します。


1. RL vs 監視あり vs 監視なし

パラダイムデータフィードバック例
監修(x, y) ペアラベル画像分類
監督なしx のみなしクラスタリング
RL状態、アクション報酬 (遅延)ゲームプレイ

RL のユニークな特性

  • 連続的な意思決定: 将来に影響を与える決定
  • 報酬の遅延: アクションが良いか悪いかすぐにはわかりません
  • 探索 vs 活用: 新しいことを試す vs 既知の知識を活用する
  • スーパーバイザーなし: 報酬シグナルのみ

2. エージェントと環境の対話ループ

すべての RL 問題はループの後に続きます。

Agent quan sát state s_t
  → Chọn action a_t theo policy π
  → Environment trả về reward r_{t+1} và state mới s_{t+1}
  → Lặp lại

例: ロボットが迷路を通過する

import gymnasium as gym

env = gym.make("FrozenLake-v1", render_mode="human")
state, info = env.reset()

for step in range(100):
    action = env.action_space.sample()  # Random policy
    next_state, reward, terminated, truncated, info = env.step(action)
    print(f"State: {state}, Action: {action}, Reward: {reward}")
    
    if terminated or truncated:
        state, info = env.reset()
    else:
        state = next_state

3. 中心となる概念

州

環境の現在の状態を完全に説明します。

アクション (a)

離散 (左/右) または連続 (回転角度) のどちらのエージェントを実行するかを決定します。

報酬 (r)

環境からのスカラー応答 — エージェントは総報酬を最大化したいと考えています。

ポリシー (π)

状態→アクションのマッピング戦略:

  • 決定論的: π(s) = a
  • 確率的: π(a|s) = P(a|s)

値関数 V(s)

状態 s から開始した場合に期待される累積報酬:

$$V^\pi(s) = \mathbb{E}\pi\left[\sum{t=0}^{\infty} \gamma^t r_{t+1} | s_0 = s\right]$$

Q関数 Q(s,a)

状態 s でアクション a を選択した場合に期待される累積報酬:

$$Q^\pi(s,a) = \mathbb{E}\pi\left[\sum{t=0}^{\infty} \gamma^t r_{t+1} | s_0 = s、a_0 = a\right]$$


4. マルコフ決定プロセス (MDP)

MDP は RL の標準的な数学的フレームワークです: (S, A, P, R, γ)

成分記号説明
州Sすべての状態のコレクション
アクションあすべてのアクションのコレクション
移行P(s's,a)
報酬R(s,a,s')報酬関数
割引γ ∈ [0,1]割引率

マルコフ特性: 未来は現在のみに依存し、過去には依存しません。


5. 探索 vs 搾取

戦略説明トレードオフ
探検新しいアクションを試すより良い戦略を見つける
搾取最もよく知られているアクションを使用します短期的な報酬を最大化する

バランス調整方法:

  • ε-greedy: 確率 ε でランダム
  • UCB: 信頼限界の上限
  • トンプソン サンプリング: ベイジアン アプローチ

概要

コンセプト説明
RLエージェントは環境とのインタラクションから学習します
MDP数学のフレームワーク: 状態、アクション、報酬
ポリシーアクション選択戦略
値予想される累積報酬
探検新しい試みと活用のバランス