AWS認定機械学習 - 専門知識 試験対策
パート4:総合復習
xdev.asia
1. SageMaker組み込みアルゴリズム — マスターテーブル
| アルゴリズム | タイプ | 最適な用途 | 入力 |
| XGBoost | 教師あり(C/R) | テーブルデータ、コンペティション | CSV、LibSVM |
| Linear Learner | 教師あり(C/R) | 高次元、高速 | CSV、RecordIO |
| Random Cut Forest | 教師なし | 異常検知 | CSV、RecordIO |
| K-Means | 教師なし | 顧客セグメンテーション | CSV、RecordIO |
| PCA | 次元削減 | 特徴量圧縮 | CSV、RecordIO |
| Factorization Machines | 教師あり(C/R) | 疎データ、レコメンデーション | RecordIOのみ |
| DeepAR+ | 教師あり | 時系列予測 | JSON Lines |
| BlazingText | 教師あり/教師なし | テキスト分類、word2vec | テキストファイル |
| Object2Vec | 教師あり | 意味的類似性 | JSON Lines |
| Image Classification | 教師あり | 画像ラベル | RecordIO、生画像 |
| Object Detection | 教師あり | バウンディングボックス | RecordIO、JSON |
| Semantic Segmentation | 教師あり | ピクセルレベル分類 | 画像 + マスク |
| LDA | 教師なし | トピックモデリング | CSV、RecordIO |
| NTM | 教師なし | ニューラルトピックモデリング | CSV、RecordIO |
| IP Insights | 教師なし | IPアドレス異常 | CSV |
2. AWS AIサービス — ノーコードML
| サービス | 目的 | 出力 |
| Amazon Rekognition | 画像/動画分析 | ラベル、顔、テキスト、モデレーション |
| Amazon Textract | 文書抽出 | テキスト、フォーム、テーブル |
| Amazon Comprehend | NLP、テキスト分析 | エンティティ、感情、トピック |
| Amazon Translate | 機械翻訳 | 翻訳テキスト |
| Amazon Transcribe | 音声テキスト変換 | 文字起こし、字幕 |
| Amazon Polly | テキスト音声変換 | 音声 |
| Amazon Lex | 会話AI(チャットボット) | インテント、スロット |
| Amazon Kendra | インテリジェント検索 | 回答、文書 |
| Amazon Personalize | レコメンデーション | アイテムランキング、ユーザーレコメンデーション |
| Amazon Forecast | 時系列予測 | 予測 + 信頼区間 |
| Amazon Lookout for Vision | 視覚的異常(製造業) | 合格/不合格、異常マップ |
| Amazon Lookout for Equipment | 設備異常(IoT) | 異常スコア |
3. 評価指標クイックリファレンス
| 指標 | 式 | 使用場面 |
| Accuracy | (TP+TN)/(TP+TN+FP+FN) | 均衡クラス |
| Precision | TP/(TP+FP) | FPのコストが高い(スパムフィルター) |
| Recall(感度) | TP/(TP+FN) | FNのコストが高い(がん診断) |
| F1スコア | 2×(P×R)/(P+R) | 不均衡クラス |
| AUC-ROC | TPR対FPR曲線下面積 | 分類器の総合品質 |
| RMSE | √(Σ(yᵢ-ŷᵢ)²/n) | 回帰、外れ値をペナルティ |
| MAE | Σ|yᵢ-ŷᵢ|/n | 回帰、外れ値にロバスト |
| MAPE | Σ|yᵢ-ŷᵢ|/|yᵢ| × 100% | 予測、解釈しやすい% |
4. 試験でよくある罠
| 罠 | 試験での表現 | 正解 |
| 不均衡データ + accuracy | 「モデルが99%のaccuracy」(不正検知) | Precision/Recall/F1を使用、accuracyではない |
| FM入力フォーマット | Factorization Machines | RecordIOのみ必須(CSVではない) |
| マネージド vs カスタム | 「最も迅速に実装」 | マネージドを優先(Personalize、Forecast) |
| 過学習の修正 | 訓練accuracyが高い、検証accuracyが低い | 正則化(L1/L2)またはデータ追加 |
| SageMaker + インターネット | 「安全な環境、インターネットなし」 | VPC + ネットワーク分離 + VPCエンドポイント |
| Ground Truthラベリング | 「ラベリングコストの削減」 | GTの自動ラベリング(能動学習) |
| モデルのバイアス | 「デプロイ前にバイアスを特定」 | SageMaker Clarify |
| 1つのエンドポイントに複数モデル | 「コスト削減、単一エンドポイント」 | マルチモデルエンドポイント(MME) |
| シナリオ | 最適な選択 |
| 大規模テーブル訓練データ | S3 + CSVまたはParquet;SageMaker用RecordIO |
| リアルタイムストリーミングデータ取り込み | Kinesis Data Streams → Firehose → S3 |
| S3データ上のアドホックSQLクエリ | Amazon Athena |
| ETL変換 → Feature Store | AWS Glue(Spark ETL)→ SageMaker Feature Store |
| BI/ダッシュボード | Amazon QuickSight |
| ML特徴量用データウェアハウス | Amazon Redshift → ML(Redshift ML) |
試験のヒント: 覚えておいてください:問題に「最速/最も簡単/ノーコード」とある場合 → AWSマネージドAIサービス。「カスタムモデル/柔軟性/自前のモデル」とある場合 → SageMaker。これが最も重要な判断基準です。