Chuyển đến nội dung chính

レッスン2:ML開発ライフサイクルとAWS AIサービス概要

MLパイプライン:データ収集→特徴量エンジニアリング→訓練→評価→デプロイ。 AWS AI/MLサービススタック。SageMaker、Rekognition、Comprehend、Polly、 Transcribe、Translate、Textract、Lex、Personalize、Forecast、Kendra。

AWSにおけるML開発ライフサイクルパイプライン

ML開発ライフサイクルパイプラインとAWS AI/MLサービススタック

1. ML開発ライフサイクル

AIF-C01試験では、問題定義からデプロイ・監視までのML開発ライフサイクル全体を理解する必要があります。

┌─────────────┐    ┌──────────────┐    ┌──────────────┐
│ 1. ビジネス  │───→│ 2. データ     │───→│ 3. 特徴量    │
│ 課題の定義   │    │ 収集と準備    │    │ エンジニア   │
│             │    │              │    │ リング       │
└─────────────┘    └──────────────┘    └──────────────┘
                                              │
┌─────────────┐    ┌──────────────┐    ┌──────┴───────┐
│ 6. 監視と    │←───│ 5. デプロイ   │←───│ 4. モデル    │
│ 再訓練       │    │ と推論       │    │ 訓練と評価   │
│             │    │              │    │              │
└─────────────┘    └──────────────┘    └──────────────┘

ステップ1:ビジネス課題の定義

  • その問題が本当にMLを必要とするか判断(ルールベースのアプローチで十分な場合もある)
  • 成功指標(KPI)を定義
  • データの入手可能性を確認

試験のコツ:「すべての問題にMLが必要なわけではない」。問題文が単純な問題を説明している場合、ルールベースのアプローチやルックアップテーブルで十分かもしれません。

ステップ2:データ収集と準備

  • データ収集:データベース、API、IoT、ログから収集
  • データクレンジング:欠損値の処理、重複の除去、エラーの修正
  • データラベリング:教師あり学習のためにデータにラベル付け → Amazon SageMaker Ground Truth
  • 探索的データ分析(EDA):分布や相関関係の可視化と理解

ステップ3:特徴量エンジニアリング

  • 特徴量選択:重要な特徴量を選択し、ノイズを除去
  • 特徴量変換:正規化、スケーリング、エンコーディング
  • 特徴量作成:生データから新しい特徴量を作成
  • AWS:SageMaker Data Wrangler、SageMaker Feature Store

ステップ4:モデル訓練と評価

  • 問題に適したアルゴリズムを選択
  • データを訓練/検証/テストセットに分割
  • モデルを訓練し、ハイパーパラメータを調整
  • 適切な指標で評価(正解率、F1、RMSEなど)
  • AWS:Amazon SageMaker(完全なMLワークフロー向け)

ステップ5:デプロイと推論

  • リアルタイム推論:即時予測のためのエンドポイント
  • バッチ推論:大量データをオフラインで処理
  • エッジデプロイ:エッジデバイスでモデルを実行
  • AWS:SageMaker Endpoints、Lambda、IoT Greengrass

ステップ6:監視と再訓練

  • モデルドリフト:データの変化に伴い時間とともにパフォーマンスが低下
  • データドリフト:入力データの分布が変化
  • コンセプトドリフト:入力と出力の関係が変化
  • 対策:監視 → ドリフトの検出 → 新しいデータで再訓練
  • AWS:SageMaker Model Monitor

2. AWS AI/MLサービススタック

AWSは3層のAI/MLサービスを提供しています。高レベル(ML知識不要)から低レベル(フルコントロール)まで:

┌─────────────────────────────────────────────────────┐
│  レイヤー3:AIサービス(事前訓練済み、APIベース)        │
│  → Rekognition、Comprehend、Polly、Transcribe、      │
│    Translate、Textract、Lex、Personalize、Forecast    │
│  → ML専門知識不要                                    │
├─────────────────────────────────────────────────────┤
│  レイヤー2:MLサービス(マネージドプラットフォーム)      │
│  → Amazon SageMaker、SageMaker JumpStart             │
│  → Amazon Bedrock(GenAI)                           │
│  → ある程度のML専門知識が必要                          │
├─────────────────────────────────────────────────────┤
│  レイヤー1:MLフレームワークとインフラ                   │
│  → GPU/Inferentia搭載EC2、Deep Learning AMI、         │
│    Deep Learning Containers                          │
│  → 十分なML専門知識が必要                              │
└─────────────────────────────────────────────────────┘

3. AWS AIサービス — サマリーテーブル

このセクションは試験で非常に重要です。各サービスの機能と使用タイミングを知る必要があります。

3.1. コンピュータービジョン

サービス機能ユースケース
Amazon Rekognition画像・動画の分析顔検出、物体検出、コンテンツモデレーション、有名人認識、画像内テキスト(OCR)
Amazon Textract文書からテキストとデータを抽出請求書処理、ID書類の抽出、フォームデータ、表の抽出
Amazon Lookout for Vision製造向け外観検査組立ラインでの製品欠陥検出

3.2. 自然言語処理(NLP)

サービス機能ユースケース
Amazon ComprehendNLP分析感情分析、エンティティ抽出、キーフレーズ、言語検出、PII検出
Amazon Translateニューラル機械翻訳リアルタイム翻訳、バッチ文書翻訳
Amazon Kendraインテリジェントエンタープライズ検索社内ナレッジ検索、FAQ、NLPによる文書検索

3.3. 音声

サービス機能方向
Amazon Pollyテキスト読み上げ(TTS)テキスト → 音声
Amazon Transcribe音声認識(STT)音声 → テキスト
Amazon Lex対話型AI(チャットボット)音声とテキストでチャットボットを構築(Alexaの基盤技術)

試験のコツ:Polly = テキストから音声へ(Pollyが「話す」)。Transcribe = 音声からテキストへ(Transcribeが「書き起こす」)。

3.4. 予測とレコメンデーション

サービス機能ユースケース
Amazon Personalizeリアルタイムのパーソナライゼーションとレコメンデーション商品レコメンデーション、パーソナライズコンテンツ
Amazon Forecast時系列予測需要計画、財務予測、リソースプランニング
Amazon Fraud Detectorオンライン不正検出決済不正、偽アカウント、アカウント乗っ取り

4. Amazon SageMaker概要

SageMakerはフルマネージドMLプラットフォームです。MLライフサイクル全体に必要なすべてを提供します。

主要コンポーネント:

コンポーネント目的
SageMaker StudioML開発用IDE(Jupyterベース)
SageMaker Ground Truthデータラベリングサービス(人間 + ML支援)
SageMaker Data Wranglerデータ準備と変換(ノーコード)
SageMaker Feature StoreML特徴量の保存と共有
SageMaker Trainingビルトインアルゴリズムによるマネージド訓練ジョブ
SageMaker AutopilotAutoML — 自動モデル構築
SageMaker JumpStart事前訓練済みモデルとソリューション(モデルハブ)
SageMaker Endpointsリアルタイム推論のためのモデルデプロイ
SageMaker Model Monitorデプロイ済みモデルのドリフト監視
SageMaker Clarifyバイアス検出とモデルの説明可能性
SageMaker Canvasビジネスユーザー向けノーコードML

SageMaker vs AIサービスの使い分け

カスタムMLモデルが必要? → SageMaker
事前訓練済みの機能が必要? → AIサービス(Rekognition、Comprehendなど)
GenAI/基盤モデルが必要? → Amazon Bedrock
ビジネスユーザー、ノーコード? → SageMaker Canvas

5. ユースケース → AWSサービスマッピング

これは試験で非常によく出題されるタイプの問題です:

ユースケースAWSサービス
写真の顔を検出Amazon Rekognition
請求書からデータを抽出Amazon Textract
カスタマーレビューの感情を分析Amazon Comprehend
コンテンツを複数言語に翻訳Amazon Translate
カスタマーサービスのチャットボットを構築Amazon Lex
ブログ記事を音声に変換Amazon Polly
会議の録音を書き起こしAmazon Transcribe
商品レコメンデーションAmazon Personalize
需要予測Amazon Forecast
社内文書を検索Amazon Kendra
不正取引を検出Amazon Fraud Detector
訓練データにラベルを付けるSageMaker Ground Truth
カスタムMLモデルを構築Amazon SageMaker
ビジネスアナリスト向けノーコードMLSageMaker Canvas
LLMでテキストを生成Amazon Bedrock

6. 練習問題

Q1:ある企業が、スキャンした請求書からテキストと構造化データを自動的に抽出したいと考えています。どのAWSサービスを使用すべきですか?

  • A) Amazon Comprehend
  • B) Amazon Rekognition
  • C) Amazon Textract ✓
  • D) Amazon Translate

解説:Textractはスキャンした文書からテキスト、フォーム、テーブルを抽出するために特別に設計されています。Comprehendはテキストの意味を分析するもので、文書の抽出ではありません。Rekognitionは画像/動画の分析用です。

Q2:データサイエンティストが、デプロイ済みモデルの予測精度がここ1ヶ月で低下していることに気づきました。入力データのパターンが変化しています。これは何と呼ばれますか?

  • A) 過学習
  • B) 未学習
  • C) データドリフト ✓
  • D) 特徴量エンジニアリング

解説:モデルの入力データの統計的特性が時間とともに変化し、パフォーマンスの低下を引き起こす場合、これをデータドリフトと呼びます。

Q3:ML経験のないビジネスアナリストが、ビジュアルインターフェースを使ってMLモデルを構築できるAWSサービスはどれですか?

  • A) SageMaker Studio
  • B) SageMaker Autopilot
  • C) SageMaker Canvas ✓
  • D) SageMaker JumpStart

解説:SageMaker Canvasはビジネスアナリスト向けのノーコード、ビジュアルポイント&クリックインターフェースを提供します。Autopilotはモデル構築を自動化しますが、ある程度のML知識が必要です。JumpStartは事前訓練済みモデルを提供します。Studioは完全なML IDEです。