Chuyển đến nội dung chính

第 11 課:LLM 評量指標 — 從 Perplexity 到 BERTScore

全面的指導指標:Perplexity、BLEU、ROUGE、METEOR、BERTScore、Exact Match、F1。何時使用哪個指標?代碼實現了每個指標。

🧠 人工智慧與機器學習 — 第 10 課 第 11 課:LLM 評量指標 — 來自 BERTcore 的困惑

微調 LLM:AI 調優的藝術

第 5 部分:模型評估 — 方法與指標

亞洲開發網

簡介

「模型好點了嗎?」—你需要具體的指標來回答,而不是感覺。本文涵蓋了所有重要指標。


1. 指標分類

┌──────────────────────────────────────────────────┐
│              LLM EVALUATION METRICS               │
├──────────────────────────────────────────────────┤
│                                                  │
│  Statistical (Lexical)     Semantic              │
│  ├── BLEU                  ├── BERTScore         │  
│  ├── ROUGE                 ├── Embedding cosine  │
│  ├── METEOR                └── BLEURT            │
│  └── Exact Match                                 │
│                                                  │
│  Training-focused          Task-specific         │
│  ├── Perplexity            ├── Accuracy          │
│  └── Loss curve            ├── F1 Score          │
│                            └── Pass@k (code)     │
│                                                  │
│  Model-based                                     │
│  ├── LLM-as-a-Judge                              │
│  └── Pairwise comparison                         │
└──────────────────────────────────────────────────┘

2. 實施每個指標

2.1 ROUGE(面對回憶的替補)

from rouge_score import rouge_scorer
scorer = rouge_scorer.RougeScorer(['rouge1','rouge2','rougeL'])
scores = scorer.score("reference text here", "generated text here")
print(f"ROUGE-L: {scores['rougeL'].fmeasure:.3f}")

2.2 BERTcore(語意相似度)

from bert_score import score
P, R, F1 = score(["generated"], ["reference"], lang="vi")
print(f"BERTScore F1: {F1.mean():.3f}")

2.3 困惑

import math
# Perplexity = exp(average negative log-likelihood)
# Thấp hơn = model tốt hơn
perplexity = math.exp(avg_loss)

3. 何時使用哪一個指標?

任務主要指標中學
文本生成ROUGE-L、BERTcore法學碩士法官
分類準確度,F1混淆矩陣
總結ROUGE-1/2/LBERT 評分
翻譯藍色、流星人類評估
程式碼產生Pass@k,精確比對測試案例
對話法學碩士法官人類偏好

總結

  • BLEU/ROUGE:快速、可重複,但僅測量詞彙重疊
  • BERTScore:測量語意相似性-更適合創意任務
  • 困惑:訓練診斷,而不是品質指標
  • 法學碩士為法官:與人類偏好的相關性最高
  • 使用組合-沒有一個單一的指標夠好

練習

  1. 實作評估套件:ROUGE + BERTScore + Perplexity
  2. 在基本模型與微調模型上運行 — 比較分數
  3. 創建可視化:比較指標的雷達圖
  4. 分析:哪個指標最能反映「真實品質」?