Chuyển đến nội dung chính

第10課:AWS負責任AI工具——Clarify、A2I與Guardrails

Amazon SageMaker Clarify(偏差偵測、可解釋性)。 Amazon Augmented AI(A2I)——人在迴路。 Amazon Bedrock Guardrails深度剖析。內容審核。

AWS負責任AI工具

AWS負責任AI工具:SageMaker Clarify、Amazon A2I和Bedrock Guardrails

1. Amazon SageMaker Clarify

SageMaker Clarify幫助偵測資料和模型中的偏差,並提供模型可解釋性——是負責任AI的首選AWS服務。

1.1. 三大核心功能

功能時機作用
訓練前偏差偵測訓練前偵測訓練資料中各人口群體的不平衡
訓練後偏差偵測訓練後偵測模型預測中的偏差(例如各群體之間準確率不同)
可解釋性(SHAP)訓練後顯示每個特徵對各預測的貢獻

1.2. Clarify中的關鍵偏差指標

指標訓練前/後衡量內容
類別不平衡(CI)訓練前各群體中類別的分佈
比例差異(DPL)訓練前各群體中正面標記的比例
KL散度訓練前群體間的分佈偏離
差異性影響(DI)訓練後各群體中正面預測的比率
準確率差異(AD)訓練後群體間的準確率差距
處理均等(TE)訓練後各群體中FP與FN的比率

1.3. Clarify工作流程

1. 設定Clarify作業
   ├── 指定敏感屬性(性別、年齡、種族)
   ├── 定義分面(要比較的群體)
   └── 選擇要計算的偏差指標

2. 執行訓練前分析
   ├── 上傳訓練資料集
   └── 取得資料分佈的偏差報告

3. 訓練模型

4. 執行訓練後分析
   ├── 比較各群體的預測
   └── 取得可解釋性的SHAP值

5. 使用SageMaker Model Monitor監控
   └── 偵測生產環境中偏差隨時間的漂移

考試提示:「哪個AWS服務可以偵測模型是否對某個種族群體產生更多錯誤?」→ SageMaker Clarify(訓練後偏差偵測)。

2. Amazon Augmented AI(Amazon A2I)

Amazon A2I為AI預測提供人在迴路(HITL)工作流程——特別重要於模型信心低或高風險決策的場景。

2.1. A2I運作方式

帶有A2I的AI預測流程:
                                          ┌─────────────┐
使用者請求 → AI模型 → 有信心?  是 → 回傳結果
                              │
                              否(低於閾值)
                              ↓
                     ┌──────────────────┐
                     │  建立人工         │
                     │  審查任務         │
                     │  (A2I工作流程)   │
                     └────────┬─────────┘
                              ↓
                     ┌──────────────────┐
                     │  人工審查員       │  ← AWS Mechanical Turk
                     │  審查與           │  ← 私人工作團隊
                     │  修正             │  ← 第三方供應商
                     └────────┬─────────┘
                              ↓
                     回傳人工驗證的結果

2.2. A2I組件

組件用途
人工審查工作流程定義何時及如何觸發人工審查
工作者任務範本人工審查員做決策的UI
工作團隊由誰進行審查(私人、Mechanical Turk、供應商)
啟動條件信心閾值觸發(例如 < 95%)

2.3. A2I內建整合

服務A2I用途
Amazon Textract審查低信心的文件擷取
Amazon Rekognition審查低信心的內容審核
自訂ML模型任何SageMaker模型都可觸發A2I

考試提示:「一家醫療公司需要在模型信心低於90%時由人工審查AI診斷」→ Amazon A2I,啟動條件設為信心 < 90%。

3. Amazon Bedrock Guardrails——深度剖析

3.1. Guardrail策略

策略運作方式設定
內容過濾器按類別+嚴重程度封鎖每個類別設定無/低/中/高(仇恨、侮辱、色情、暴力、不當行為)
禁止主題封鎖特定主題自然語言描述+範例短語
詞彙過濾器封鎖特定詞語自訂詞語/短語列表+不雅詞過濾器開關
敏感資訊(PII)偵測PII並採取行動每種PII類型設定封鎖或匿名化(SSN、電子郵件、電話、姓名、地址等)
上下文基礎檢查回答是否基於上下文基礎閾值(0-1)+相關性閾值

3.2. Guardrails處理請求的方式

使用者輸入
    ↓
[輸入Guardrails]
    ├── 內容過濾器檢查
    ├── 禁止主題檢查
    ├── 詞彙過濾器檢查
    ├── PII偵測 → 封鎖或匿名化
    ↓(如果通過所有檢查)
基礎模型生成回應
    ↓
[輸出Guardrails]
    ├── 內容過濾器檢查
    ├── 禁止主題檢查
    ├── 詞彙過濾器檢查
    ├── PII偵測 → 封鎖或匿名化
    ├── 上下文基礎檢查
    ↓(如果通過所有檢查)
回應回傳給使用者

如果被封鎖 → 回傳設定的「封鎖」訊息

3.3. Guardrails vs 系統提示

面向系統提示Guardrails
執行方式軟性——模型可能忽略硬性——由平台強制執行
繞過風險可透過提示注入繞過無法被提示繞過
PII處理要求模型不輸出PII程式化偵測與遮蔽
可稽核性有限完整的日誌和指標

考試提示:「一家公司需要保證PII永遠不會出現在模型回應中」→ Bedrock Guardrails(非系統提示,因為系統提示可以被繞過)。

4. AWS上的內容審核

服務內容類型用途
Amazon Rekognition圖像與影片偵測不當內容、人臉、文字
Amazon Comprehend文字毒性偵測、情感分析
Bedrock GuardrailsFM輸入/輸出在生成式AI應用中過濾有害內容
Amazon A2I任何邊緣案例的人工審查

5. AI治理

5.1. 治理框架

領域應實施的內容
政策組織範圍的AI倫理準則
風險評估部署AI系統前評估風險
監控持續監控偏差、效能漂移
稽核軌跡記錄所有模型決策以確保問責
人工監督高風險決策採用人在迴路
文件記錄模型卡片、AI Service Cards

5.2. SageMaker ML治理

  • SageMaker模型卡片:記錄模型詳情和預期用途
  • SageMaker模型儀表板:所有模型狀態的集中視圖
  • SageMaker Model Monitor:偵測資料漂移、模型品質下降
  • SageMaker Role Manager:ML的細粒度存取控制

6. 練習題

Q1:一家保險公司想確保其理賠審核模型公平對待所有年齡的客戶。他們應該使用哪個AWS服務來偵測模型預測中的年齡偏差?

  • A) Amazon Rekognition
  • B) Amazon SageMaker Clarify ✓
  • C) Amazon Bedrock Guardrails
  • D) Amazon Comprehend

解說:SageMaker Clarify可以執行訓練後偏差分析,使用差異性影響和準確率差異等指標來比較各年齡群體的模型預測。

Q2:一個使用Amazon Textract的文件處理應用程式,需要在擷取資料信心低時進行人工審查。哪個AWS服務提供此功能?

  • A) Amazon SageMaker Ground Truth
  • B) Amazon Augmented AI(A2I) ✓
  • C) 直接使用Amazon Mechanical Turk
  • D) Amazon Bedrock Agents

解說:Amazon A2I與Amazon Textract有內建整合,當擷取信心低於定義的閾值時可自動觸發人工審查工作流程。

Q3:一個聊天機器人必須永遠不在回應中揭露客戶的信用卡號碼,即使資料存在於知識庫中。哪種方法提供最強的保證?

  • A) 在系統提示中加入「絕不輸出信用卡號碼」
  • B) 微調模型使其不輸出PII
  • C) 使用Amazon Bedrock Guardrails並將PII過濾器設為封鎖 ✓
  • D) 從知識庫中移除信用卡號碼

解說:Bedrock Guardrails的PII過濾器在輸入和輸出中都提供程式化的信用卡號碼偵測和封鎖——這無法被提示注入繞過,不像系統提示。