前言
本地 AI 技術棧能運作只是開始。您需要衡量品質、偵測劣化,並以 SLO 向團隊提供保證。
1. 核心指標
GenAI 系統需要的四個核心指標:
- 延遲(p50/p95/p99)
- 接地性(引用正確率)
- Token 成本(每次請求估算)
- 錯誤率(schema 失敗、逾時)
2. 建構 Golden Set
Golden set 包含:
- 20-50 個標準問題
- 每個問題的預期回答要素
- 自動化評分腳本
定期執行以追蹤品質趨勢。
3. 線上回饋迴路
使用者信號:
- 👍/👎 按鈕
- 「回答錯誤」回報
- 重新生成請求
將這些信號匯聚到儀表板,及早偵測品質劣化。
4. 定義 SLO
AI 功能的 SLO 範例:
| 指標 | 目標 | 衡量期間 |
|---|---|---|
| 延遲 p95 | < 5 秒 | 7 天 |
| 接地性 | > 85% | 7 天 |
| 可用性 | > 99% | 30 天 |
| 錯誤率 | < 5% | 7 天 |
也請定義未達 SLO 時的升級程序。
5. 儀表板設計
最少應包含的面板:
- 請求量(時間序列)
- 延遲分佈
- 各模型錯誤率
- 回饋分數趨勢
- 使用中的模型版本
Demo 程式碼
Eval framework 執行結果 — 分數摘要:
