Chuyển đến nội dung chính

AI のためのデータ ガバナンス:リネージ、保有、PII 分類、プロヴァナンス

Duy Tran10分
AI のためのデータ ガバナンス:リネージ、保有、PII 分類、プロヴァナンス

「このデータを AI トレーニングに使用できるか?」「顧客データをどのくらい保持するのか?」「本番環境データにアクセスできる人は誰か?」— データ ガバナンス ポリシーがない場合、BA に明確な答えはありません。

このガイドは BA が AI 機能用のデータ ガバナンス フレームワークを構築する方法を教えます。


1. データ ガバナンス対データ セキュリティ

側面データ ガバナンスデータ セキュリティ
焦点どのデータ?どこから?何に使用?誰がアクセス?どのように保護?
所有者BA、データ スチュワードセキュリティ チーム、DevOps
範囲リネージ、ライフサイクル、品質暗号化、監査ログ、アクセス制御
質問「このデータを使用できるか?」「誰がこのデータにアクセスできるか?」

**BA はガバナンスに焦点を当て、**セキュリティ チームはコントロールを実装します。


2. データ リネージ — ソースからデータを追跡

データ リネージ = ソース → 処理 → AI → 出力からのデータの文書化されたパス

例:AI チャットボットが製品の推奨を提案

ソース データ:
  ├─ 本番 DB:user_transactions テーブル
  ├─ サード パーティ:product_catalog API
  └─ ユーザー入力:チャット メッセージ

処理:
  ├─ ETL パイプラインが user_transactions を毎日抽出
  ├─ product_catalog と結合
  ├─ user_id → user_hash を匿名化
  └─ AI 機能データベースにロード

AI 処理:
  ├─ Embedding モデルが user_hash + product_features を消費
  ├─ 類似度検索 + ランキング
  └─ 上位 5 推奨を出力

出力:
  └─ フロントエンドが推奨を表示
      ├─→ ユーザーが見た推奨を追跡
      ├─→ ユーザーがクリックした推奨を追跡
      └─→ トレーニング データへのフィードバック ループ?

BA がドキュメント化する必要がある:

  • ソース システム + 抽出頻度
  • データ変換ルール(匿名化?集計?)
  • AI データが保存されているデータベース/テーブル
  • アクセス権限(読み取り専用?書き込み?)
  • 保有:処理後、ソース データをどのくらい保持?

3. データ 分類 — PII / PHI / Public

感度レベルでデータを分類:

レベル定義例ハンドリング
Public機密でない、共有可能製品カタログ、一般的なフィードバック制限なし
Internal社内のみ、顧客向けではない売上メトリクス、社内メールアクセス制限
Confidential (PII/PHI)顧客個人/健康データ名前、メール、電話、医療記録暗号化、匿名化、監査ログ
Restricted規制要件クレジットカード、生体認証データコンプライアンス チーム承認

例:

ユーザー テーブル フィールド:
- user_id(数値) → INTERNAL(識別に役立つ)
- email → CONFIDENTIAL(PII、GDPR)
- age → CONFIDENTIAL(PII、差別リスク)
- purchase_history → INTERNAL + 追跡
- medical_history → RESTRICTED(HIPAA 下の PHI)

フィールドごとのポリシー:
- AI トレーニング データにどの機能を含められるか?
- どの機能を匿名化する必要があるか?
- AI に使用できない機能は?

4. 保有ポリシー — 保持期間

ポリシー:顧客トランザクション データ保有

生データ(ソース):
  ├─ 本番 DB で保持:3 年(財務監査要件による)
  ├─ 1 年後にコールド ストレージに移動
  └─ 3 年後に削除(法的保有ない限り)

AI トレーニング データ(処理済み):
  ├─ 匿名化スナップショット保持:モデル バージョン管理用 6 か月
  ├─ ユーザーがオプトアウトしたら即座に削除
  └─ ユーザー アカウント削除時に削除(GDPR 忘れられる権利)

チャット履歴(ユーザー インタラクション):
  ├─ ホット ストレージで 30 日間保持(エスカレーション ハンドリング用)
  ├─ 30 日後にアーカイブ(コールド ストレージ 60 日)
  └─ 合計 90 日後に削除(ユーザーがトレーニングにオプトイン中止)

削除のトリガー:

  • ユーザーが削除をリクエスト(忘れられる権利)
  • ユーザーが AI トレーニングからオプトアウト
  • 保有期間が期限切れ
  • データ品質チェック失敗
  • 規制要件が変更

5. プロヴァナンス追跡 — 誰がデータを使用?いつ?

すべてのアクセス/使用を追跡:

監査ログ例:

タイムスタンプ       | アクター      | アクション                | アクセス データ              | 結果
2026-05-05 10:15 | david@co     | Download data export  | user_transactions.csv  | ✅ 成功
2026-05-05 10:20 | ai_pipeline  | Read user_features    | anonymized_user_*.db   | ✅ 50K レコード
2026-05-05 10:25 | sarah@qa     | Execute unit test     | test_dataset.json      | ✅ すべてパス
2026-05-05 10:30 | external_ai  | Attempted read PII    | email_addresses.csv    | ❌ ブロック

監査するもの:

  • データにアクセスした人(ユーザー/サービス アカウント)
  • いつ(タイムスタンプ)
  • どのデータ(テーブル/フィールド レベル)
  • アクション(読み取り/書き込み/削除/エクスポート)
  • 結果(成功/ブロック/エラー)
  • コンテキスト(どの IP、どのシステム)

6. データ ガバナンス ポリシー テンプレート

# データ ガバナンス ポリシー:[AI 機能名]

## 1. データ 分類

| データ ソース | 分類 | PII? | 感度 | 使用 |
|----------|-------------|-------|--------|------|
| user_id | Internal | いいえ | 中程度 | Train、serve |
| email | Confidential | はい | 高 | Serve のみ、train なし |
| age | Confidential | はい | 高 | 匿名化後に Train |

## 2. データ リネージ

- **ソース**:production.user_transactions(MySQL)
- **抽出**:毎日 2 AM(UTC)Airflow DAG 経由
- **処理**:
  - PII を匿名化(メール ハッシュ、電話削除)
  - 年齢を 5 年バケットに集計
- **ストレージ**:warehouse.ai_features(BigQuery)
- **保有**:モデル バージョン用 6 か月

## 3. アクセス制御

| 役割 | データ | 権限 | コンテキスト |
|------|------|---------|-----------|
| データ サイエンティスト | anonymized_features | 読み取り | モデル トレーニング用のみ |
| ML エンジニア | model_artifacts | 読み取り/書き込み | Prod デプロイ |
| BA | 使用メトリクス | 読み取り | 月次レビュー |
| 外部 AI ベンダー | なし | - | 直接アクセスなし |

## 4. 保有スケジュール

- 生データ:3 年間保持
- 匿名化データ:6 か月間保持
- チャット ログ:30 日間(ホット)→ 90 日間(コールド)→ 削除
- 削除トリガー:ユーザー オプトアウト、アカウント削除、保有期限

## 5. ユーザー権利

- ユーザーが要求可能:私たちが持っているデータは何か?
- ユーザーが要求可能:私のデータをすべて削除(GDPR)
- ユーザーが要求可能:データをエクスポート
- ユーザーがオプトアウト可能:「AI トレーニングに会話を使用しないでください」

## 6. コンプライアンス 要件

- GDPR:個人データは同意 + 削除権が必要
- CCPA:カリフォルニア州居民はデータ販売からオプトアウト可能
- HIPAA:健康データは AI 使用前に非識別化が必要
- 地方法:[地域固有を追加]

7. BA 向け実装チェックリスト

開発前
☐ すべてのソースのデータ分類を定義
☐ PII/PHI フィールドを特定
☐ 決定:匿名化または除外?
☐ 保有ポリシーを設定
☐ リネージをドキュメント化
☐ コンプライアンス レビューを取得

開発中
☐ 機密フィールドのデータ マスキングを実装
☐ 監査ログを追加
☐ データ削除をテスト(保有期限切れ)
☐ ユーザー オプトアウト トリガーをテスト
☐ QA が正しいデータ フローを検証

リリース後
☐ 月次監査ログ レビュー
☐ 四半期保有ポリシー レビュー
☐ 監視:不正なアクセス?
☐ 追跡:ユーザー削除リクエスト?
☐ 規制が変わったらポリシーを更新

8. BA が防ぐべき一般的な違反

❌「後でデータを匿名化する」→ データは PII のまま ✅ ソースで匿名化、AI 処理前

❌「モデル改善用にユーザー チャットを 5 年間保持」→ GDPR 違反 ✅ デフォルトで 30 日間保持、ユーザー オプトアウトまたは忘れられる権利で削除

❌「AI ベンダーは本番環境データベースへのアクセスが必要」→ セキュリティ ナイトメア ✅ 月次に匿名化データセットをエクスポート、ベンダーはそれで作業

❌「監査証跡は不要、社内」→ 後で準拠を証明できない ✅ 常にログ:誰が、何を、いつ、なぜ、すべてのデータ アクセス


まとめ

AI のデータ ガバナンス = 分類(PII?)+ リネージ(どこから?)+ 保有(どのくらい?)+ アクセス(誰が見える?)+ プロヴァナンス(監査証跡)。

BA はシステムを構築する必要はありませんが、開発ビルド前に明確なポリシーを定義する必要があります。後でコンプライアンス質問が生じたときに、BA が参照すべき具体的なポリシーがあります。