Chuyển đến nội dung chính

AI 的資料治理:譜系、保留、PII 分類、來源追蹤

Duy Tran10 分鐘
AI 的資料治理:譜系、保留、PII 分類、來源追蹤

「這些資料可以用於訓練 AI 嗎?」「客戶資料保留多久?」「誰可以訪問生產資料?」——沒有資料治理政策,BA 就沒有明確的答案。

本指南教 BA 如何為 AI 功能構建資料治理框架。


1. 資料治理與資料安全

面向資料治理資料安全
焦點哪些資料?來自哪裡?用於什麼?誰可以訪問?如何保護?
所有者BA、資料管理員安全團隊、DevOps
範圍譜系、生命週期、品質加密、稽核日誌、訪問控制
問題「我們可以使用這些資料嗎?」「誰可以訪問這些資料?」

BA 專注於治理; 安全團隊實施控制。


2. 資料譜系 — 從來源追蹤資料

資料譜系 = 從來源 → 處理 → AI → 輸出的資料的文件化路徑

範例:AI 聊天機器人建議產品推薦

來源資料:
  ├─ 生產 DB:user_transactions 表
  ├─ 第三方:product_catalog API
  └─ 使用者輸入:聊天訊息

處理:
  ├─ ETL 管道每天提取 user_transactions
  ├─ 與 product_catalog 結合
  ├─ 將 user_id 匿名化 → user_hash
  └─ 載入到 AI 功能資料庫

AI 處理:
  ├─ Embedding 模型消費 user_hash + 產品特徵
  ├─ 相似度搜尋 + 排名
  └─ 輸出前 5 項推薦

輸出:
  └─ 前端顯示推薦
      ├─ 追蹤:使用者看到哪些推薦
      ├─ 追蹤:使用者點擊哪些推薦
      └─ 回饋迴圈返回訓練資料?

BA 必須記錄:

  • 來源系統 + 提取頻率
  • 資料轉換規則(匿名化?聚合?)
  • AI 資料儲存位置的資料庫/表
  • 誰有訪問權(唯讀?寫入?)
  • 保留:處理後多久保留來源資料?

3. 資料分類 — PII / PHI / 公開

按敏感程度分類資料:

級別定義範例處理
公開非敏感、可共享產品目錄、通用反饋無限制
內部僅限公司、不面向客戶銷售指標、內部電郵受限訪問
機密 (PII/PHI)客戶個人/健康資料姓名、郵箱、電話、醫療記錄加密、匿名化、稽核日誌
受限法規要求信用卡、生物特徵資料合規團隊批准

範例:

使用者表欄位:
- user_id(數字) → INTERNAL(可幫助識別)
- email → CONFIDENTIAL(PII、GDPR)
- age → CONFIDENTIAL(PII、歧視風險)
- purchase_history → INTERNAL + 追蹤
- medical_history → RESTRICTED(HIPAA 下的 PHI)

每個欄位的政策:
- 哪些特徵可以在 AI 訓練資料中?
- 哪些特徵必須匿名化?
- 哪些根本無法用於 AI?

4. 保留政策 — 保留多久?

政策:客戶交易資料保留

原始資料(來源):
  ├─ 在生產 DB 中保留:3 年(根據財務稽核要求)
  ├─ 1 年後移到冷儲存
  └─ 3 年後刪除(除非有法律保留)

AI 訓練資料(已處理):
  ├─ 保留匿名化快照:6 個月用於模型版本控制
  ├─ 使用者選擇退出時立即刪除
  └─ 使用者帳戶刪除時刪除(GDPR 被遺忘權)

聊天記錄(使用者互動):
  ├─ 在熱儲存中保留 30 天(用於上報處理)
  ├─ 30 天後存檔(冷儲存 60 天)
  └─ 總共 90 天後刪除(除非使用者選擇加入訓練)

刪除觸發:

  • 使用者要求刪除(被遺忘權)
  • 使用者從 AI 訓練中選擇退出
  • 保留期限到期
  • 資料品質檢查失敗
  • 法規要求變更

5. 來源追蹤 — 誰使用資料?何時?

追蹤每次訪問/使用:

稽核日誌範例:

時戳              | 使用者      | 操作                 | 訪問的資料            | 結果
2026-05-05 10:15 | david@co   | Download data export | user_transactions.csv | ✅ 成功
2026-05-05 10:20 | ai_pipeline| Read user_features   | anonymized_user_*.db  | ✅ 50K 筆記錄
2026-05-05 10:25 | sarah@qa   | Execute unit test    | test_dataset.json     | ✅ 全部通過
2026-05-05 10:30 | external_ai| Attempted read PII   | email_addresses.csv   | ❌ 已封鎖

稽核的內容:

  • 誰訪問了資料(使用者/服務帳戶)
  • 何時(時戳)
  • 什麼資料(表/欄位級)
  • 操作(讀取/寫入/刪除/匯出)
  • 結果(成功/封鎖/錯誤)
  • 背景(哪個 IP、哪個系統)

6. 資料治理政策範本

# 資料治理政策:[AI 功能名稱]

## 1. 資料分類

| 資料來源 | 分類 | PII? | 敏感度 | 用途 |
|---------|------|-------|--------|------|
| user_id | Internal | 否 | 中等 | Train、serve |
| email | Confidential | 是 | 高 | 僅 serve、不 train |
| age | Confidential | 是 | 高 | 匿名化後 train |

## 2. 資料譜系

- **來源**:production.user_transactions(MySQL)
- **提取**:每天凌晨 2 點(UTC)透過 Airflow DAG
- **處理**:
  - 匿名化 PII(雜湊郵箱、移除電話)
  - 將年齡聚合到 5 年桶
- **儲存**:warehouse.ai_features(BigQuery)
- **保留**:6 個月用於模型版本

## 3. 訪問控制

| 角色 | 資料 | 權限 | 背景 |
|------|------|------|------|
| 資料科學家 | anonymized_features | 讀取 | 僅用於模型訓練 |
| ML 工程師 | model_artifacts | 讀取/寫入 | Prod 部署 |
| BA | 使用指標 | 讀取 | 月度審查 |
| 外部 AI 廠商 | 無 | - | 無直接訪問 |

## 4. 保留時間表

- 原始資料:保留 3 年
- 匿名化資料:保留 6 個月
- 聊天日誌:保留 30 天(熱)→ 90 天(冷)→ 刪除
- 刪除觸發:使用者選擇退出、帳戶刪除、保留期限

## 5. 使用者權利

- 使用者可要求:我們持有您的哪些資料?
- 使用者可要求:刪除我的所有資料(GDPR)
- 使用者可要求:匯出我的資料
- 使用者可選擇退出:「不要用我的對話訓練 AI」

## 6. 合規要求

- GDPR:個人資料必須有同意 + 刪除權
- CCPA:加州居民可選擇退出資料銷售
- HIPAA:健康資料必須在 AI 使用前去識別化
- 地方法規:[新增特定地區]

7. BA 的實施檢查清單

開發前
☐ 為每個來源定義資料分類
☐ 識別 PII/PHI 欄位
☐ 決定:匿名化或排除?
☐ 設定保留政策
☐ 記錄譜系
☐ 取得合規審查

開發期間
☐ 實施機密欄位的資料遮罩
☐ 新增稽核日誌
☐ 測試資料刪除(保留期限)
☐ 測試使用者選擇退出觸發
☐ QA 驗證正確的資料流

發布後
☐ 每月稽核日誌審查
☐ 每季度保留政策審查
☐ 監控:任何未授權訪問?
☐ 追蹤:任何使用者刪除要求?
☐ 如果法規變化則更新政策

8. BA 應防止的常見違規

❌「稍後匿名化資料」→ 資料永遠保持 PII 狀態 ✅ 在來源匿名化,在 AI 處理前

❌「為了模型改進保留使用者聊天 5 年」→ GDPR 違規 ✅ 預設保留 30 天,在使用者選擇退出或被遺忘時刪除

❌「AI 廠商需要訪問生產資料庫」→ 安全噩夢 ✅ 每月匯出匿名化資料集,廠商使用該資料

❌「不需要稽核追蹤,這是內部的」→ 稍後無法證明合規 ✅ 始終記錄:誰、什麼、何時、為什麼、每次資料訪問


總結

AI 的資料治理 = 分類(PII?)+ 譜系(來自哪裡?)+ 保留(保留多久?)+ 訪問(誰看得到?)+ 來源追蹤(稽核線索)。

BA 不需要構建系統,但在開發構建前必須定義明確的政策。當稍後出現合規問題時,BA 有具體的政策可以參考。