Chuyển đến nội dung chính

第9課:Responsible AI與安全性

Google的Responsible AI原則。Vertex AI Explainability(SHAP、IG)。 公平性指標。隱私:差分隱私、聯邦學習。 IAM、VPC-SC、CMEK保護ML工作負載。

📝 考試準備 — 第9課 第9課:Responsible AI & 安全性

Google Cloud Professional Machine Learning Engineer 考試準備

領域5:Responsible AI與複習

xdev.asia

1. Google的Responsible AI原則

原則主要要求
對社會有益為社會和個人帶來利益
避免不公平的偏見跨人口統計群體測試公平性
安全性在多種情境中測試,持續評估
可問責適當的人類監督和控制
隱私保護保護訓練資料的隱私
科學卓越嚴格的研究標準
用於有益目的主要利益標準

2. Vertex AI Explainability

Vertex AI Explainability提供特徵歸因分數,解釋模型為何做出特定預測。

方法適用對象運作方式
SHAP(Shapley Values)表格模型賽局理論:每個特徵的貢獻度
Integrated Gradients(IG)神經網路(影像、文字)從基準線到輸入的梯度累積
XRAI影像模型像素區域歸因(比IG更好的UX)
Sampled Shapley大型表格資料集近似SHAP,速度更快

考試提示:「解釋貸款被拒絕的原因」→ 表格模型用SHAP。「標記影響分類的影像區域」→ Integrated Gradients或XRAI。Vertex AI Explainability需要在部署端點時啟用。

3. 公平性與偏見偵測

工具/概念說明
Fairness IndicatorsGCP工具:評估跨人口統計切片的模型公平性指標
What-If Tool互動式探索模型行為、反事實分析
Demographic parity跨人口統計群體的相同預測率
Equal opportunity跨群體的相同Recall/TPR
資料切片評估TFX Evaluator按性別、種族、年齡評估指標

4. 隱私技術

技術說明
差分隱私在訓練資料/模型中添加統計雜訊,防止個人資料被重新識別
聯邦學習在分散的資料上訓練而不集中原始資料——只共享模型更新
資料匿名化在訓練前移除PII(Cloud DLP API)

5. ML工作負載的安全控制

控制目的
IAM角色ML服務帳號的最小權限存取
VPC Service Controls(VPC-SC)安全邊界:防止BigQuery、GCS資料外洩
CMEK(客戶管理加密金鑰)透過Cloud KMS控制加密金鑰
Vertex AI私有IP訓練和端點使用私有網路
Cloud Audit Logs誰在何時存取了什麼資料(Data Access + Admin Activity)
VPC Service Controls Perimeter:

┌────── Security Perimeter ─────────┐
│  BigQuery  │  Cloud Storage       │
│  Vertex AI │  Cloud KMS           │
│  Dataflow  │  Secret Manager      │
└──────────────────────────────────┘
         │ (no exfiltration outside perimeter)
         ✗ Unauthorized access blocked

6. 練習題

Q1: 金融服務公司部署了貸款審批ML模型。監管機構要求解釋特定貸款申請被拒絕的原因。哪個Vertex AI功能為表格模型提供逐筆預測的特徵重要性分數?

  • A) Vertex AI Experiments
  • B) 使用SHAP的Vertex AI Explainability ✓
  • C) Vertex AI Model Monitoring
  • D) Fairness Indicators

解說:使用Shapley Values(SHAP)的Vertex AI Explainability為每個個別預測中的每個特徵分配重要性分數,將模型的決策歸因於credit_score、income、debt_ratio等特定輸入特徵,解釋特定貸款被拒絕的原因。

Q2: 一家醫療公司需要在分散於多家醫院的患者資料上訓練ML模型。資料隱私法規禁止集中原始患者記錄。應使用哪種隱私保護ML方法?

  • A) 集中訓練搭配差分隱私
  • B) 聯邦學習 ✓
  • C) 資料匿名化 + BigQuery ML
  • D) Cloud DLP去識別化

解說:聯邦學習在不將原始資料移動到中央位置的情況下,在分散的資料上訓練模型。每家醫院在自己的資料上進行本地訓練,只有模型更新(梯度)被共享和聚合。原始患者記錄不會離開醫院的環境。

Q3: 企業在BigQuery中處理ML訓練用的敏感金融資料。需要防止資料被移動到授權安全邊界之外的未授權GCP專案。應實作哪個GCP功能?

  • A) Cloud KMS CMEK加密
  • B) VPC Service Controls(VPC-SC)邊界 ✓
  • C) IAM角色拒絕政策
  • D) Cloud Armor WAF

解說:VPC Service Controls在GCP服務(BigQuery、Cloud Storage、Vertex AI)周圍建立安全邊界。透過阻止將資料移動到定義邊界之外的請求來防止資料外洩,即使是來自已認證的使用者。CMEK提供加密控制但不能防止外洩。