はじめに
BLEU、ROUGE は「表面」を測定しますが、AI の品質は最終的に 人間 または より賢い AI によって判断される必要があります。これら 2 つは最も強力な方法です。
1. 裁判官としての LLM
1.1 ポイントごとのスコアリング
JUDGE_PROMPT = """Evaluate the response on a scale of 1-5:
**Task:** {task}
**Response:** {response}
Criteria:
- Accuracy (1-5): Thông tin chính xác không?
- Completeness (1-5): Trả lời đầy đủ không?
- Format (1-5): Đúng format yêu cầu không?
- Tone (1-5): Giọng điệu phù hợp không?
Output JSON: {"accuracy": X, "completeness": X, "format": X, "tone": X, "overall": X, "reasoning": "..."}
"""
1.2 ペアごとの比較
PAIRWISE_PROMPT = """Compare Response A vs Response B:
Task: {task}
Response A: {response_a}
Response B: {response_b}
Which is better? Output: {"winner": "A" or "B" or "tie", "reasoning": "..."}
"""
2. 人間の評価
ゴールデン テスト セット
golden_tests = [
{
"input": "Triệu chứng COVID-19?",
"expected_elements": ["sốt", "ho", "mệt mỏi", "mất vị giác"],
"expected_format": "bullet list",
"rubric": "Phải mention ít nhất 3/4 triệu chứng chính"
},
# 50+ test cases
]
アノテーター間の合意
from sklearn.metrics import cohen_kappa_score
kappa = cohen_kappa_score(annotator_1_scores, annotator_2_scores)
# kappa > 0.6 = acceptable agreement
概要
- LLM-as-Judge: 高速、スケーラブル、人間との良好な相関関係
- ペアごとの比較: ポイントごとのスコアリングよりも強力です
- 人間による評価: ゴールドスタンダードだが高価で時間がかかる
- ゴールデン テスト セット: ドメイン向けに厳選された 50 以上のサンプル
- LLM-Judge + 人間によるサンプリングの組み合わせ = ベスト プラクティス
演習
- ドメインの審査員プロンプトをデザインする (5 つのルーブリック基準)
- ペアごとの比較を実行します: 基本と微調整 (20 例)
- 30 個以上のサンプルからなるゴールデン テスト セットを作成する
- アノテーター間の合意を測定する (レビューア 2 名を招待)