Chuyển đến nội dung chính

レッスン 12: 裁判官としての LLM と人間の評価

LLM は LLM をレビューします — デザインジャッジプロンプト、ルーブリックスコアリング。ペアごとの比較。人間による評価: ゴールデン テスト セット、アノテーション ガイドライン、アノテーター間の合意。

🧠 AI と ML — レッスン 11 レッスン 12: 裁判官としての LLM と人間の評価

LLM の微調整: AI チューニングの技術

パート 5: モデルの評価 — メソッドとメトリクス

xdev.asia

はじめに

BLEU、ROUGE は「表面」を測定しますが、AI の品質は最終的に 人間 または より賢い AI によって判断される必要があります。これら 2 つは最も強力な方法です。


1. 裁判官としての LLM

1.1 ポイントごとのスコアリング

JUDGE_PROMPT = """Evaluate the response on a scale of 1-5:

**Task:** {task}
**Response:** {response}

Criteria:
- Accuracy (1-5): Thông tin chính xác không?
- Completeness (1-5): Trả lời đầy đủ không?
- Format (1-5): Đúng format yêu cầu không?
- Tone (1-5): Giọng điệu phù hợp không?

Output JSON: {"accuracy": X, "completeness": X, "format": X, "tone": X, "overall": X, "reasoning": "..."}
"""

1.2 ペアごとの比較

PAIRWISE_PROMPT = """Compare Response A vs Response B:

Task: {task}
Response A: {response_a}
Response B: {response_b}

Which is better? Output: {"winner": "A" or "B" or "tie", "reasoning": "..."}
"""

2. 人間の評価

ゴールデン テスト セット

golden_tests = [
    {
        "input": "Triệu chứng COVID-19?",
        "expected_elements": ["sốt", "ho", "mệt mỏi", "mất vị giác"],
        "expected_format": "bullet list",
        "rubric": "Phải mention ít nhất 3/4 triệu chứng chính"
    },
    # 50+ test cases
]

アノテーター間の合意

from sklearn.metrics import cohen_kappa_score
kappa = cohen_kappa_score(annotator_1_scores, annotator_2_scores)
# kappa > 0.6 = acceptable agreement

概要

  • LLM-as-Judge: 高速、スケーラブル、人間との良好な相関関係
  • ペアごとの比較: ポイントごとのスコアリングよりも強力です
  • 人間による評価: ゴールドスタンダードだが高価で時間がかかる
  • ゴールデン テスト セット: ドメイン向けに厳選された 50 以上のサンプル
  • LLM-Judge + 人間によるサンプリングの組み合わせ = ベスト プラクティス

演習

  1. ドメインの審査員プロンプトをデザインする (5 つのルーブリック基準)
  2. ペアごとの比較を実行します: 基本と微調整 (20 例)
  3. 30 個以上のサンプルからなるゴールデン テスト セットを作成する
  4. アノテーター間の合意を測定する (レビューア 2 名を招待)