Chuyển đến nội dung chính

AI 功能的 UAT 和業務準備:從測試計畫到 Go/No-Go 決定

Duy Tran10 分鐘
AI 功能的 UAT 和業務準備:從測試計畫到 Go/No-Go 決定

UAT 是 BA 和業務利益關係人在上線前運行的最終測試輪。對傳統功能來說,合格/不合格很清楚。AI 功能更複雜:AI 可能技術上運作但業務還不準備接受。


1. 為什麼 AI 的 UAT 不同

面向傳統功能AI 功能
測試情況輸入 X → 輸出 Y 固定輸入 X → 輸出 Y 可變
合格/不合格二進制可能是「可接受範圍」
邊界情況有限、可列舉幾乎無限
偏差測試不需要必要
使用者信任不太相關重要——使用者信任 AI 嗎?
回滾代碼回復可能需要模型版本回滾

2. AI 功能的三層 UAT

層 1:功能 UAT(傳統)

測試核心業務流程:

  • 按驗收標準的成功路徑
  • 無效輸入的錯誤處理
  • 與其他系統的整合

層 2:AI 輸出品質 UAT

在業務脈絡中測試 AI 輸出品質:

  • 精確度:輸出在測試集上有多準確?
  • 相關性:回答是否對應脈絡?
  • 幻覺檢查:AI 是否編造資訊?
  • 語調·格式:是否符合品牌/政策?

方法: BA + 領域專家準備黃金測試集。50-100 個樣本輸入配預期輸出。在此集合運行 AI 並評分。

黃金測試集範本:
| 測試 ID | 輸入 | 預期 | 實際 | 合格/不合格 | 備註 |
|--------|------|------|------|-----------|------|
| TC-001 | 「利率...」 | 「當前利率...」 | ... | ... | ... |

層 3:業務準備 UAT

測試組織準備(不只系統):

  • 使用者已培訓嗎?
  • 幫助台/代理知道當 AI 失敗時如何處理嗎?
  • 回滾程序準備好了嗎?
  • 監測儀表板已上線嗎?

3. AI 功能用 UAT 計畫範本

# UAT 計畫:[功能名稱]

## 1. 範圍和目標
- 功能:[描述]
- UAT 期間:[開始 → 結束日期]
- 環境:[UAT env URL、資料集]
- 目標:驗證 [業務目標列表]

## 2. 參與者
| 角色 | 人員 | 責任 |
|------|------|------|
| UAT 主導 (BA) | ... | 計畫、協調、簽核 |
| 業務測試者 | ... | 執行測試情況 |
| 領域專家 | ... | 評估 AI 輸出品質 |
| 產品所有者 | ... | Go/No-Go 決定 |

## 3. 測試情景

### 群組 A:功能(必須通過)
- [TC-F-001] 成功路徑:[描述]
- [TC-F-002] 錯誤路徑:[描述]

### 群組 B:AI 品質(接受閾值)
- [TC-AI-001] 黃金測試集精確度 ≥ [N]%
- [TC-AI-002] 測試集幻覺率 ≤ [M]%
- [TC-AI-003] 信心 < 閾值時升級正確

### 群組 C:業務準備(必須完成)
- [TC-BR-001] 訓練資料 [團隊] 審查
- [TC-BR-002] 回滾程序已測試
- [TC-BR-003] 監測警告已配置

4. Go/No-Go 決定框架

BA 統合 UAT 結果並提議 go/no-go:

類別標準狀態重量
阻斷者0 個重大缺陷✅/❌必須通過
阻斷者精確度 ≥ 閾值✅/❌必須通過
阻斷者人類覆蓋運作✅/❌必須通過
重要所有成功路徑通過✅/❌高
重要業務測試者簽核✅/❌高
很好有所有邊界情況通過✅/❌中
很好有SLA 內效能✅/❌中

決定規則:

  • ✅ 所有阻斷者 → GO
  • ❌ 任何阻斷者 → NO-GO(修復並重測)
  • GO 但重要缺陷 → 已知問題 GO(明確溝通)

5. 業務準備檢查清單

上線前 BA 驗證:

使用者訓練
☐ 使用者指南 / FAQ 已撰寫並審查
☐ 訓練課程已排程
☐ 用戶沙盒/示範環境可用
☐ 變更管理電郵已起草

支持準備
☐ 幫助台/代理知道 AI 可能失敗及如何處理
☐ AI → 代理 → 主管升級路徑明確
☐ 關於 AI 限制的常見問題已供支持團隊用
☐ 已知限制文件已分享

技術準備
☐ 監測儀表板已上線並測試
☐ 警告規則已配置(精確度下降、錯誤率激增)
☐ 回滾程序已記載並測試
☐ 上線日的待命排程

通訊
☐ 上線公告草稿已批准
☐ 內部利益關係人 [N] 天前通知
☐ 外部通訊(如有)已批准

6. AI 功能的上線策略

不是總是 100% 立即上線。常見策略:

策略何時使用風險
完整上線低風險、高信心最高
金絲雀 (5% → 20% → 100%)中風險、需監測更低、早期發現
A/B 測試想測量業務影響需足夠樣本
影子模式AI 後台運行、人類決定零使用者影響、資料收集

總結

AI 功能的良好 UAT = 功能測試 + AI 品質測試 + 業務準備。BA 連結三者,不只是運行測試情況。

關鍵思維轉變:接受閾值,不是絕對合格/不合格。85% AI 精確度可能「夠好」——但「夠好」必須利益關係人事先同意,不是結果後決定。