GCP AI/ML生態系統:Vertex AI、AutoML、BigQuery ML、預訓練API與其使用時機
1. GCP ML全景概覽
GCP ML Capability Spectrum:
LOW CODE ◄────────────────────────────────────► HIGH CONTROL
│ │ │
▼ ▼ ▼
Pre-trained APIs Vertex AI AutoML Custom Training
(Vision, NLP, (no code needed, (full control,
Translation) you bring data) you bring code)
│ │ │
No ML expertise Some domain ML expertise
needed expertise required
BigQuery ML ────── SQL interface for ML on warehouse data
2. Vertex AI — 統一ML平台
Vertex AI是GCP整合整個ML生命週期的統一平台。充分理解各元件是考試的必要條件。
| 元件 | 用途 |
|---|---|
| Vertex AI Workbench | 資料科學家使用的託管Jupyter筆記本 |
| Vertex AI Training | 自訂訓練工作(CPU、GPU、TPU) |
| Vertex AI AutoML | 無程式碼模型訓練(Tabular、Image、Text、Video) |
| Vertex AI Endpoints | 部署模型進行線上預測 |
| Vertex AI Batch Prediction | 非同步批次評分 |
| Vertex AI Feature Store | 在訓練/推論間一致地提供特徵 |
| Vertex AI Pipelines | 基於Kubeflow Pipelines的ML工作流程協調 |
| Vertex AI Experiments | 追蹤執行、比較指標 |
| Vertex AI Model Registry | 模型版本控制 |
| Vertex AI Model Monitoring | 偵測特徵偏移與預測漂移 |
3. AutoML vs. 自訂訓練
| 標準 | AutoML | 自訂訓練 |
|---|---|---|
| 需要的ML專業知識 | 最少 | 必要 |
| 訓練時間 | 數小時(自動化) | 可變(您控制) |
| 模型可解釋性 | 有限 | 完全控制 |
| 成本 | 每個模型較高 | 按使用的運算資源付費 |
| 最適用途 | 快速原型、標準任務 | 自訂架構、研究 |
| 支援的資料類型 | Tabular、Image、Text、Video | 任何(您撰寫程式碼) |
考試提示: 「團隊沒有ML專業知識」或「最快部署時間」→ AutoML。「自訂神經網路架構」或「完全控制訓練迴圈」→ 自訂訓練。
4. BigQuery ML
BigQuery ML允許使用SQL訓練和服務ML模型 — 無需從BigQuery匯出資料。
| 模型類型 | SQL關鍵字 | 使用場景 |
|---|---|---|
| 線性迴歸 | LINEAR_REG | 價格預測 |
| 邏輯迴歸 | LOGISTIC_REG | 分類 |
| K-Means聚類 | KMEANS | 客戶分群 |
| XGBoost | BOOSTED_TREE_CLASSIFIER/REGRESSOR | 表格資料分類/迴歸 |
| 深度神經網路 | DNN_CLASSIFIER/DNN_REGRESSOR | 複雜模式 |
| 矩陣分解 | MATRIX_FACTORIZATION | 推薦系統 |
| 匯入的TF模型 | TENSORFLOW | 自訂TF模型 |
5. 預訓練AI API
| API | 功能 | 使用場景 |
|---|---|---|
| Cloud Vision API | 標籤、OCR、臉部偵測、標誌、安全搜尋 | 無需訓練的影像分析 |
| Cloud Natural Language API | 實體、情感分析、語法、分類 | 文字分析 |
| Cloud Translation API | 100+語言對 | 多語言內容 |
| Cloud Speech-to-Text | 語音轉文字、說話者分離 | 音訊處理 |
| Cloud Text-to-Speech | WaveNet語音、SSML | 語音UI、無障礙功能 |
| Document AI | 表單解析、發票提取 | 文件自動化 |
| Recommendations AI | 即時商品推薦 | 電商個人化 |
6. 服務選擇決策樹
WHICH GCP ML SERVICE?
Do you have LABELED DATA?
│
├── NO → Pre-trained API sufficient for your task (Vision, NLP)?
│ YES → Use Pre-trained API
│ NO → Vertex AI Custom Training (unsupervised)
│
└── YES → Is your data already IN BigQuery?
│
├── YES → BigQuery ML (SQL-based, fast, no export)
│
└── NO → Need rapid prototyping, no ML team?
│
├── YES → Vertex AI AutoML
│
└── NO → Vertex AI Custom Training
7. 練習題
Q1: 資料分析團隊在BigQuery中有PB級的客戶交易資料。他們想利用現有的SQL技能,在不匯出資料的情況下建構流失預測模型。最佳方法是什麼?
- A) 匯出到Cloud Storage,然後使用Vertex AI自訂訓練
- B) 使用Cloud Natural Language API
- C) 使用BigQuery ML搭配CREATE MODEL LOGISTIC_REGRESSION ✓
- D) 使用Vertex AI AutoML Tabular
解說:BigQuery ML允許利用現有的資料基礎設施和技能,使用SQL直接在BigQuery資料上訓練分類模型,無需匯出資料。當資料已在BigQuery中時,這是最快的路徑。
Q2: 一個小型新創公司需要為客戶評論添加情感分析功能。他們沒有ML團隊,也沒有標籤的情感資料。哪個解決方案需要最少的工作量?
- A) Vertex AI AutoML Text Sentiment
- B) 在Vertex AI上訓練自訂BERT模型
- C) Cloud Natural Language API情感分析 ✓
- D) BigQuery ML DNN分類器
解說:Cloud Natural Language API是預訓練的全託管服務,不需要訓練資料、ML專業知識或基礎設施設定。只需呼叫API即可。AutoML需要標籤的情感範例;自訂BERT需要大量的專業知識。
Q3: 為確保模型訓練時使用的特徵值與預測時提供的特徵值相同,團隊應使用哪個Vertex AI元件?
- A) Vertex AI Experiments
- B) Vertex AI Feature Store ✓
- C) Vertex AI Model Registry
- D) Vertex AI Pipelines
解說:Vertex AI Feature Store提供ML特徵的集中式儲存庫,用於儲存、提供和共享ML特徵。它在訓練和線上/批次預測中使用相同的特徵定義和值,確保訓練-推論一致性,防止訓練-推論偏移。