UAT 是 BA 和業務利益關係人在上線前運行的最終測試輪。對傳統功能來說,合格/不合格很清楚。AI 功能更複雜:AI 可能技術上運作但業務還不準備接受。
1. 為什麼 AI 的 UAT 不同
| 面向 | 傳統功能 | AI 功能 |
|---|---|---|
| 測試情況 | 輸入 X → 輸出 Y 固定 | 輸入 X → 輸出 Y 可變 |
| 合格/不合格 | 二進制 | 可能是「可接受範圍」 |
| 邊界情況 | 有限、可列舉 | 幾乎無限 |
| 偏差測試 | 不需要 | 必要 |
| 使用者信任 | 不太相關 | 重要——使用者信任 AI 嗎? |
| 回滾 | 代碼回復 | 可能需要模型版本回滾 |
2. AI 功能的三層 UAT
層 1:功能 UAT(傳統)
測試核心業務流程:
- 按驗收標準的成功路徑
- 無效輸入的錯誤處理
- 與其他系統的整合
層 2:AI 輸出品質 UAT
在業務脈絡中測試 AI 輸出品質:
- 精確度:輸出在測試集上有多準確?
- 相關性:回答是否對應脈絡?
- 幻覺檢查:AI 是否編造資訊?
- 語調·格式:是否符合品牌/政策?
方法: BA + 領域專家準備黃金測試集。50-100 個樣本輸入配預期輸出。在此集合運行 AI 並評分。
黃金測試集範本:
| 測試 ID | 輸入 | 預期 | 實際 | 合格/不合格 | 備註 |
|--------|------|------|------|-----------|------|
| TC-001 | 「利率...」 | 「當前利率...」 | ... | ... | ... |
層 3:業務準備 UAT
測試組織準備(不只系統):
- 使用者已培訓嗎?
- 幫助台/代理知道當 AI 失敗時如何處理嗎?
- 回滾程序準備好了嗎?
- 監測儀表板已上線嗎?
3. AI 功能用 UAT 計畫範本
# UAT 計畫:[功能名稱]
## 1. 範圍和目標
- 功能:[描述]
- UAT 期間:[開始 → 結束日期]
- 環境:[UAT env URL、資料集]
- 目標:驗證 [業務目標列表]
## 2. 參與者
| 角色 | 人員 | 責任 |
|------|------|------|
| UAT 主導 (BA) | ... | 計畫、協調、簽核 |
| 業務測試者 | ... | 執行測試情況 |
| 領域專家 | ... | 評估 AI 輸出品質 |
| 產品所有者 | ... | Go/No-Go 決定 |
## 3. 測試情景
### 群組 A:功能(必須通過)
- [TC-F-001] 成功路徑:[描述]
- [TC-F-002] 錯誤路徑:[描述]
### 群組 B:AI 品質(接受閾值)
- [TC-AI-001] 黃金測試集精確度 ≥ [N]%
- [TC-AI-002] 測試集幻覺率 ≤ [M]%
- [TC-AI-003] 信心 < 閾值時升級正確
### 群組 C:業務準備(必須完成)
- [TC-BR-001] 訓練資料 [團隊] 審查
- [TC-BR-002] 回滾程序已測試
- [TC-BR-003] 監測警告已配置
4. Go/No-Go 決定框架
BA 統合 UAT 結果並提議 go/no-go:
| 類別 | 標準 | 狀態 | 重量 |
|---|---|---|---|
| 阻斷者 | 0 個重大缺陷 | ✅/❌ | 必須通過 |
| 阻斷者 | 精確度 ≥ 閾值 | ✅/❌ | 必須通過 |
| 阻斷者 | 人類覆蓋運作 | ✅/❌ | 必須通過 |
| 重要 | 所有成功路徑通過 | ✅/❌ | 高 |
| 重要 | 業務測試者簽核 | ✅/❌ | 高 |
| 很好有 | 所有邊界情況通過 | ✅/❌ | 中 |
| 很好有 | SLA 內效能 | ✅/❌ | 中 |
決定規則:
- ✅ 所有阻斷者 → GO
- ❌ 任何阻斷者 → NO-GO(修復並重測)
- GO 但重要缺陷 → 已知問題 GO(明確溝通)
5. 業務準備檢查清單
上線前 BA 驗證:
使用者訓練
☐ 使用者指南 / FAQ 已撰寫並審查
☐ 訓練課程已排程
☐ 用戶沙盒/示範環境可用
☐ 變更管理電郵已起草
支持準備
☐ 幫助台/代理知道 AI 可能失敗及如何處理
☐ AI → 代理 → 主管升級路徑明確
☐ 關於 AI 限制的常見問題已供支持團隊用
☐ 已知限制文件已分享
技術準備
☐ 監測儀表板已上線並測試
☐ 警告規則已配置(精確度下降、錯誤率激增)
☐ 回滾程序已記載並測試
☐ 上線日的待命排程
通訊
☐ 上線公告草稿已批准
☐ 內部利益關係人 [N] 天前通知
☐ 外部通訊(如有)已批准
6. AI 功能的上線策略
不是總是 100% 立即上線。常見策略:
| 策略 | 何時使用 | 風險 |
|---|---|---|
| 完整上線 | 低風險、高信心 | 最高 |
| 金絲雀 (5% → 20% → 100%) | 中風險、需監測 | 更低、早期發現 |
| A/B 測試 | 想測量業務影響 | 需足夠樣本 |
| 影子模式 | AI 後台運行、人類決定 | 零使用者影響、資料收集 |
總結
AI 功能的良好 UAT = 功能測試 + AI 品質測試 + 業務準備。BA 連結三者,不只是運行測試情況。
關鍵思維轉變:接受閾值,不是絕對合格/不合格。85% AI 精確度可能「夠好」——但「夠好」必須利益關係人事先同意,不是結果後決定。
