Chuyển đến nội dung chính

第2課:ML開發生命週期與AWS AI服務概覽

ML管線:資料收集 → 特徵工程 → 訓練 → 評估 → 部署。 AWS AI/ML服務堆疊。SageMaker、Rekognition、Comprehend、Polly、 Transcribe、Translate、Textract、Lex、Personalize、Forecast、Kendra。

AWS上的ML開發生命週期管線

ML開發生命週期管線與AWS AI/ML服務堆疊

1. ML開發生命週期

AIF-C01考試要求您理解完整的ML開發生命週期 — 從問題定義到部署和監控。

┌─────────────┐    ┌──────────────┐    ┌──────────────┐
│ 1. 商業      │───→│ 2. 資料       │───→│ 3. 特徵       │
│ 問題定義     │    │ 收集與準備    │    │ 工程          │
└─────────────┘    └──────────────┘    └──────────────┘
                                              │
┌─────────────┐    ┌──────────────┐    ┌──────┴───────┐
│ 6. 監控      │←───│ 5. 部署       │←───│ 4. 模型       │
│ 與重新訓練   │    │ 與推論        │    │ 訓練與評估    │
└─────────────┘    └──────────────┘    └──────────────┘

步驟1:商業問題定義

  • 判斷問題是否真的需要ML(有時基於規則的方法就足夠了)
  • 定義成功指標(KPI)
  • 確定資料可用性

考試提示:「並非每個問題都需要ML。」如果題目描述的是簡單問題,基於規則的方法或查詢表可能就足夠了。

步驟2:資料收集與準備

  • 資料收集:從資料庫、API、IoT、日誌中收集
  • 資料清理:處理缺失值、移除重複、修正錯誤
  • 資料標記:為監督式學習標記資料 → Amazon SageMaker Ground Truth
  • 探索性資料分析(EDA):視覺化、理解分布、相關性

步驟3:特徵工程

  • 特徵選擇:選擇重要特徵,移除雜訊
  • 特徵轉換:正規化、縮放、編碼
  • 特徵創建:從原始資料創建新特徵
  • AWS:SageMaker Data Wrangler、SageMaker Feature Store

步驟4:模型訓練與評估

  • 選擇適合問題的演算法
  • 將資料分為訓練集/驗證集/測試集
  • 訓練模型,調整超參數
  • 使用適當的指標進行評估(準確率、F1、RMSE...)
  • AWS:Amazon SageMaker用於完整ML工作流程

步驟5:部署與推論

  • 即時推論:用於即時預測的端點
  • 批次推論:離線處理大型資料集
  • 邊緣部署:在邊緣設備上執行模型
  • AWS:SageMaker Endpoints、Lambda、IoT Greengrass

步驟6:監控與重新訓練

  • 模型漂移:隨著資料變化,效能隨時間下降
  • 資料漂移:輸入資料分布發生變化
  • 概念漂移:輸入和輸出之間的關係發生變化
  • 解決方案:監控 → 偵測漂移 → 使用新資料重新訓練
  • AWS:SageMaker Model Monitor

2. AWS AI/ML服務堆疊

AWS提供3層AI/ML服務 — 從高階(不需ML知識)到低階(完全控制):

┌─────────────────────────────────────────────────────┐
│  第3層:AI服務(預訓練、基於API)                      │
│  → Rekognition、Comprehend、Polly、Transcribe、       │
│    Translate、Textract、Lex、Personalize、Forecast     │
│  → 不需要ML專業知識                                   │
├─────────────────────────────────────────────────────┤
│  第2層:ML服務(託管平台)                              │
│  → Amazon SageMaker、SageMaker JumpStart              │
│  → Amazon Bedrock(GenAI)                            │
│  → 需要一些ML專業知識                                  │
├─────────────────────────────────────────────────────┤
│  第1層:ML框架與基礎設施                                │
│  → 帶GPU/Inferentia的EC2、Deep Learning AMI、          │
│    Deep Learning Containers                           │
│  → 需要完整ML專業知識                                  │
└─────────────────────────────────────────────────────┘

3. AWS AI服務 — 總覽表

本節對考試非常重要 — 您需要知道每個服務的功能和使用時機。

3.1. 電腦視覺

服務功能使用案例
Amazon Rekognition影像和影片分析人臉偵測、物體偵測、內容審核、名人辨識、影像中的文字(OCR)
Amazon Textract從文件中擷取文字和資料發票處理、身份證件擷取、表單資料、表格擷取
Amazon Lookout for Vision製造業視覺檢查生產線上的產品缺陷偵測

3.2. 自然語言處理(NLP)

服務功能使用案例
Amazon ComprehendNLP分析情緒分析、實體擷取、關鍵詞組、語言偵測、PII偵測
Amazon Translate神經機器翻譯即時翻譯、批次文件翻譯
Amazon Kendra智慧企業搜尋內部知識搜尋、FAQ、NLP驅動的文件搜尋

3.3. 語音

服務功能方向
Amazon Polly文字轉語音(TTS)文字 → 音訊
Amazon Transcribe語音轉文字(STT)音訊 → 文字
Amazon Lex對話式AI(聊天機器人)建立語音和文字聊天機器人(驅動Alexa)

考試提示:Polly = 文字轉語音(Polly「說話」)。Transcribe = 語音轉文字(Transcribe「記錄」)。

3.4. 預測與推薦

服務功能使用案例
Amazon Personalize即時個人化與推薦產品推薦、個人化內容
Amazon Forecast時間序列預測需求規劃、財務預測、資源規劃
Amazon Fraud Detector偵測線上欺詐支付欺詐、假帳號、帳號盜用

4. Amazon SageMaker概覽

SageMaker是一個全受管ML平台 — 提供整個ML生命週期所需的一切。

關鍵組件:

組件用途
SageMaker StudioML開發IDE(基於Jupyter)
SageMaker Ground Truth資料標記服務(人工 + ML輔助)
SageMaker Data Wrangler資料準備與轉換(無程式碼)
SageMaker Feature Store儲存與共享ML特徵
SageMaker Training帶內建演算法的受管訓練作業
SageMaker AutopilotAutoML — 自動模型構建
SageMaker JumpStart預訓練模型與解決方案(模型中心)
SageMaker Endpoints部署模型進行即時推論
SageMaker Model Monitor監控已部署模型的漂移
SageMaker Clarify偏差偵測與模型可解釋性
SageMaker Canvas商業用戶的無程式碼ML

何時使用SageMaker vs AI服務?

需要自訂ML模型?→ SageMaker
需要預訓練功能?→ AI服務(Rekognition、Comprehend等)
需要GenAI/基礎模型?→ Amazon Bedrock
商業用戶、無程式碼?→ SageMaker Canvas

5. 使用案例 → AWS服務對應

這是考試中非常常見的題型:

使用案例AWS服務
偵測照片中的人臉Amazon Rekognition
從發票中擷取資料Amazon Textract
分析客戶評論情緒Amazon Comprehend
將內容翻譯成多種語言Amazon Translate
建立客服聊天機器人Amazon Lex
將部落格文章轉為音訊Amazon Polly
轉錄會議錄音Amazon Transcribe
產品推薦Amazon Personalize
需求預測Amazon Forecast
搜尋內部文件Amazon Kendra
偵測欺詐交易Amazon Fraud Detector
標記訓練資料SageMaker Ground Truth
建立自訂ML模型Amazon SageMaker
商業分析師的無程式碼MLSageMaker Canvas
用LLM生成文字Amazon Bedrock

6. 練習題

Q1:一家公司想要從掃描的發票中自動擷取文字和結構化資料。應該使用哪個AWS服務?

  • A) Amazon Comprehend
  • B) Amazon Rekognition
  • C) Amazon Textract ✓
  • D) Amazon Translate

解說:Textract專門設計用於從掃描文件中擷取文字、表單和表格。Comprehend分析文字含義,而非文件擷取。Rekognition用於影像/影片分析。

Q2:一位資料科學家注意到其已部署的模型在過去一個月預測準確率下降了。輸入資料模式已改變。這稱為什麼?

  • A) 過擬合
  • B) 欠擬合
  • C) 資料漂移 ✓
  • D) 特徵工程

解說:當模型輸入資料的統計特性隨時間改變導致效能下降時,這稱為資料漂移。

Q3:哪個AWS服務允許沒有ML經驗的商業分析師使用視覺介面建立ML模型?

  • A) SageMaker Studio
  • B) SageMaker Autopilot
  • C) SageMaker Canvas ✓
  • D) SageMaker JumpStart

解說:SageMaker Canvas為商業分析師提供無程式碼、視覺化的點擊介面。Autopilot自動化模型構建但需要一些ML知識。JumpStart提供預訓練模型。Studio是完整的ML IDE。