Chuyển đến nội dung chính

第9課:負責任AI——公平性、偏差與透明度

負責任AI原則。偏差的類型(資料、演算法、社會)。 公平性指標、模型可解釋性(SHAP、LIME)。 AWS AI Service Cards,AI中的透明度。

負責任AI支柱

負責任AI支柱與ML管線中的偏差進入點

1. 什麼是負責任AI?

負責任AI是一個確保AI系統以道德、公平、透明和負責的方式開發和使用的框架。

1.1. 負責任AI的支柱

支柱定義範例
公平性公平對待所有群體貸款審核模型不因種族而歧視
可解釋性理解模型為何做出該決策「您的貸款被拒是因為負債收入比 > 0.5」
透明度清楚說明AI的能力與限制當內容是AI生成時予以揭露
隱私保護個人資料未經同意不在PII上訓練
安全性防止有害輸出內容過濾器、防護機制
穩健性在對抗條件下仍可靠抵禦提示注入攻擊
治理監督和問責對高風險決策進行人工審查

2. 理解AI中的偏差

2.1. 偏差的類型

偏差類型內容範例
選擇偏差訓練資料無法代表總體招聘模型僅用科技公司資料訓練
衡量偏差資料收集不一致不同人口群體的影像品質不同
確認偏差模型強化現有模式推薦系統只展示使用者已喜歡的內容
標記偏差人工標記員引入偏差不同標註者之間情感標記不一致
演算法偏差模型架構放大偏差最佳化準確率偏向多數群體
回憶偏差過度代表的歷史模式某些地區有更多逮捕資料→預測該地區犯罪更多
抽樣偏差非隨機資料收集線上調查遺漏年長族群

2.2. 偏差在ML生命週期中的進入點

資料收集        資料處理        模型訓練        評估          部署
  ↓                ↓               ↓             ↓            ↓
選擇偏差        特徵工程       演算法偏差       評估          回饋
抽樣偏差        缺失值         最佳化           指標偏差      迴路偏差
衡量偏差        編碼選擇       目標函數                       使用者偏差

考試提示:「偏差可以在ML管線的哪個階段被引入?」→ 每個階段——資料收集、預處理、模型訓練、評估和部署。這就是為什麼在整個生命週期中進行監控至關重要。

3. 公平性指標

3.1. 關鍵公平性概念

概念定義
人口統計均等各群體以相同比率獲得正面結果
機會均等各群體之間真陽性率相等
均等化勝算各群體之間TPR和FPR相等
個體公平性相似的個體獲得相似的結果
差異性影響群體間正面結果的比率(80%規則)

3.2. 偵測偏差

  • 訓練前:分析訓練資料在各人口群體中的分佈
  • 訓練後:比較模型在各群體中的預測
  • 執行時:監控即時預測中公平性指標的漂移

4. 模型可解釋性

可解釋性 = 理解模型為什麼做出特定預測的能力。

4.1. 可解釋性技術

技術類型功能
SHAP(SHapley Additive exPlanations)模型無關顯示每個特徵對預測的貢獻
LIME(Local Interpretable Model-agnostic Explanations)模型無關透過局部近似來解釋個別預測
特徵重要性模型特定按影響力排名特徵
注意力視覺化Transformer特定顯示模型關注了哪些token
部分依賴圖模型無關顯示特徵如何影響預測
SHAP 範例:
貸款申請:拒絕

特徵貢獻:
  負債收入比:           +0.42(推向拒絕)
  信用評分:             +0.28(推向拒絕)
  工作年資:             -0.15(推向核准)
  貸款金額:             +0.08(推向拒絕)
  年齡:                 -0.03(中性)
                        ─────────────
  基準(平均預測):      0.45
  最終預測:             0.45 + 0.42 + 0.28 - 0.15 + 0.08 - 0.03 = 1.05 → 拒絕

考試提示:「如何解釋ML模型為何拒絕貸款申請?」→ SHAP值——顯示每個特徵對個別預測的貢獻。AWS上的SageMaker Clarify提供此功能。

5. AI中的透明度

5.1. AWS AI Service Cards

AI Service Cards是AWS提供的公開文件,為AWS AI服務提供透明度:

  • 預期用途:服務設計的用途
  • 限制:已知的限制和故障模式
  • 設計選擇:模型如何建構
  • 最佳實踐:建議的使用模式
  • 公平性考量:已知的人口群體效能差異

適用於:Amazon Rekognition、Textract、Comprehend、Transcribe等。

5.2. 模型卡片

模型卡片(來自SageMaker)是你為自己的模型建立的內部文件:

  • 模型描述和預期用途
  • 訓練資料詳情
  • 各子群體的效能指標
  • 倫理考量
  • 限制和風險

5.3. 透明度最佳實踐

實踐方式
揭露AI使用告知使用者他們正在與AI互動
來源標註在RAG應用程式中引用來源
信心分數向使用者展示模型的信心程度
限制揭露記錄模型不能做的事情
浮水印標記AI生成的內容(圖像、文字)

6. 毒性與有害內容

有害內容的類型:

  • 仇恨言論:針對受保護群體的內容
  • 暴力:血腥或宣揚暴力
  • 色情內容:露骨或不當
  • 自我傷害:宣揚自殘或自殺
  • 錯誤資訊:以事實方式呈現的不正確內容
  • 提示注入:覆蓋系統指令的惡意提示

緩解策略:

  1. 內容過濾器:自動偵測和封鎖(Bedrock Guardrails)
  2. 人工審查:高風險內容採用人在迴路
  3. 輸入清理:驗證和清理使用者輸入
  4. 輸出過濾:在向使用者展示之前檢查模型輸出
  5. 紅隊測試:部署前的對抗性測試

7. 練習題

Q1:一個招聘AI系統持續將男性候選人排名高於同等資格的女性候選人。最可能存在哪種類型的偏差?

  • A) 衡量偏差
  • B) 訓練資料中的選擇偏差 ✓
  • C) 確認偏差
  • D) 回憶偏差

解說:如果訓練資料包含偏向男性候選人的歷史招聘決策,模型就會學習並複製該選擇偏差。訓練資料未能公平地代表合格人口。

Q2:一家銀行被監管機構要求解釋每筆貸款申請被核准或拒絕的原因。哪個AWS服務功能可以提供每次預測的解釋?

  • A) Amazon Bedrock Guardrails
  • B) 帶有SHAP值的Amazon SageMaker Clarify ✓
  • C) Amazon Comprehend情感分析
  • D) AWS AI Service Cards

解說:SageMaker Clarify計算SHAP值,顯示每個特徵對個別預測的貢獻,提供監管機構所需的可解釋性。

Q3:哪個AWS資源提供關於AWS AI服務預期用途、限制和公平性考量的公開文件?

  • A) SageMaker模型卡片
  • B) AWS AI Service Cards ✓
  • C) Amazon Bedrock Model Evaluation
  • D) AWS Trusted Advisor

解說:AWS AI Service Cards是公開文件,提供AWS AI服務(如Rekognition、Textract和Comprehend)的設計、限制和最佳實踐的透明度。模型卡片是用於你自己的自訂模型。