Chuyển đến nội dung chính

課程 7:GenAI 的 Eval Framework、Observability 與 SLO

設計 golden set、線上回饋迴路、延遲/接地性/成本指標, 定義 AI 功能的 SLO。

🧠 AI & ML — L0 課程 7:GenAI 的 Eval Framework、 Observability 與 SLO Gemma 4 本地 AI 工程實戰 on Mac 第四部分:可靠性、成本與生產環境強化 xdev.asia

前言

本地 AI 技術棧能運作只是開始。您需要衡量品質、偵測劣化,並以 SLO 向團隊提供保證。

1. 核心指標

GenAI 系統需要的四個核心指標:

  • 延遲(p50/p95/p99)
  • 接地性(引用正確率)
  • Token 成本(每次請求估算)
  • 錯誤率(schema 失敗、逾時)

2. 建構 Golden Set

Golden set 包含:

  • 20-50 個標準問題
  • 每個問題的預期回答要素
  • 自動化評分腳本

定期執行以追蹤品質趨勢。

3. 線上回饋迴路

使用者信號:

  • 👍/👎 按鈕
  • 「回答錯誤」回報
  • 重新生成請求

將這些信號匯聚到儀表板,及早偵測品質劣化。

4. 定義 SLO

AI 功能的 SLO 範例:

指標目標衡量期間
延遲 p95< 5 秒7 天
接地性> 85%7 天
可用性> 99%30 天
錯誤率< 5%7 天

也請定義未達 SLO 時的升級程序。

5. 儀表板設計

最少應包含的面板:

  • 請求量(時間序列)
  • 延遲分佈
  • 各模型錯誤率
  • 回饋分數趨勢
  • 使用中的模型版本

Demo 程式碼

Eval framework 執行結果 — 分數摘要:

Eval 分數

原始碼:06-eval-framework

總結