AWS認證機器學習 - 專業級 考試準備
第4部分:總複習與考試策略
xdev.asia
1. SageMaker內建演算法總表
| 演算法 | 類型 | 最適用途 | 輸入 |
| XGBoost | 監督式(分類/迴歸) | 表格數據、競賽 | CSV、LibSVM |
| Linear Learner | 監督式(分類/迴歸) | 高維、快速 | CSV、RecordIO |
| Random Cut Forest | 非監督式 | 異常檢測 | CSV、RecordIO |
| K-Means | 非監督式 | 客戶分群 | CSV、RecordIO |
| PCA | 維度縮減 | 特徵壓縮 | CSV、RecordIO |
| Factorization Machines | 監督式(分類/迴歸) | 稀疏數據、推薦 | 僅RecordIO |
| DeepAR+ | 監督式 | 時間序列預測 | JSON Lines |
| BlazingText | 監督式/非監督式 | 文本分類、word2vec | 文本檔案 |
| Object2Vec | 監督式 | 語義相似度 | JSON Lines |
| Image Classification | 監督式 | 影像標籤 | RecordIO、原始影像 |
| Object Detection | 監督式 | 邊界框 | RecordIO、JSON |
| Semantic Segmentation | 監督式 | 像素級分類 | 影像 + 遮罩 |
| LDA | 非監督式 | 主題建模 | CSV、RecordIO |
| NTM | 非監督式 | 神經網路主題建模 | CSV、RecordIO |
| IP Insights | 非監督式 | IP位址異常 | CSV |
2. AWS AI服務 — 無程式碼ML
| 服務 | 用途 | 輸出 |
| Amazon Rekognition | 影像/影片分析 | 標籤、人臉、文字、內容審核 |
| Amazon Textract | 文件擷取 | 文字、表單、表格 |
| Amazon Comprehend | NLP、文本分析 | 實體、情感、主題 |
| Amazon Translate | 機器翻譯 | 翻譯文本 |
| Amazon Transcribe | 語音轉文字 | 轉錄、字幕 |
| Amazon Polly | 文字轉語音 | 音訊 |
| Amazon Lex | 對話式AI(聊天機器人) | 意圖、槽位 |
| Amazon Kendra | 智慧搜尋 | 答案、文件 |
| Amazon Personalize | 推薦 | 項目排名、使用者推薦 |
| Amazon Forecast | 時間序列預測 | 預測 + 信賴區間 |
| Amazon Lookout for Vision | 視覺異常(製造) | 通過/不通過、異常圖 |
| Amazon Lookout for Equipment | 設備異常(IoT) | 異常分數 |
3. 評估指標快速參考
| 指標 | 公式 | 使用時機 |
| Accuracy | (TP+TN)/(TP+TN+FP+FN) | 平衡類別 |
| Precision | TP/(TP+FP) | FP成本高(垃圾郵件過濾器) |
| Recall(靈敏度) | TP/(TP+FN) | FN成本高(癌症診斷) |
| F1分數 | 2×(P×R)/(P+R) | 不平衡類別 |
| AUC-ROC | TPR vs FPR曲線下面積 | 整體分類器品質 |
| RMSE | √(Σ(yᵢ-ŷᵢ)²/n) | 迴歸、懲罰離群值 |
| MAE | Σ|yᵢ-ŷᵢ|/n | 迴歸、對離群值穩健 |
| MAPE | Σ|yᵢ-ŷᵢ|/|yᵢ| × 100% | 預測、可解讀的百分比 |
4. 考試常見陷阱
| 陷阱 | 考試敘述 | 正確答案 |
| 不平衡數據 + accuracy | 「模型有99% accuracy」(欺詐) | 使用Precision/Recall/F1,非accuracy |
| FM輸入格式 | Factorization Machines | 僅需RecordIO(非CSV) |
| 託管 vs 自訂 | 「最快實現」 | 優先託管服務(Personalize、Forecast) |
| 過擬合修復 | 訓練accuracy高、驗證低 | 正規化(L1/L2)或更多數據 |
| SageMaker + 網際網路 | 「安全環境、無網際網路」 | VPC + 網路隔離 + VPC端點 |
| Ground Truth標註 | 「降低標註成本」 | GT中的自動標註(主動學習) |
| 模型偏差 | 「部署前識別偏差」 | SageMaker Clarify |
| 單一端點多模型 | 「節省成本、單一端點」 | 多模型端點(MME) |
| 情境 | 最佳選擇 |
| 大型表格訓練數據 | S3 + CSV或Parquet;SageMaker用RecordIO |
| 即時串流數據攝取 | Kinesis Data Streams → Firehose → S3 |
| S3數據的臨時SQL查詢 | Amazon Athena |
| ETL轉換 → Feature Store | AWS Glue(Spark ETL)→ SageMaker Feature Store |
| 商業智慧/儀表板 | Amazon QuickSight |
| ML特徵的數據倉儲 | Amazon Redshift → ML(Redshift ML) |
考試提示: 請記住:當題目說「最快/最簡單/無程式碼」→ AWS託管AI服務。當說「自訂模型/彈性/自帶」→ SageMaker。這是最重要的判斷標準。