Chuyển đến nội dung chính

第7課:模型部署與預測

Vertex AI Endpoints:線上預測、批次預測。 模型版本管理、流量分割。邊緣部署(Edge Manager)。 擴展設定、GPU分配。

Vertex AI Model Deployment

Vertex AI部署:線上預測、批次預測、流量分割與邊緣部署

1. Vertex AI上的預測類型

類型延遲使用時機
線上預測毫秒級(同步)即時應用程式、面向使用者的API
批次預測分鐘/小時(非同步)大型資料集、排程評分
串流預測近即時Pub/Sub事件 + Dataflow + Vertex AI

2. Vertex AI Endpoints

Vertex AI Endpoint Architecture:

Client Request
    ↓
Vertex AI Endpoint (load balancer)
    ├── Model Version A (70% traffic)
    │       └── Deployed Model (e.g., v1.0)
    └── Model Version B (30% traffic)  ← Canary/A-B test
            └── Deployed Model (e.g., v1.1)

每個Endpoint可以有多個模型版本配合流量分割——用於A/B測試和金絲雀部署。

功能詳細
專用端點專用資源、最低延遲、較高成本
共享端點多租戶、較低成本、可能有冷啟動
可解釋性為每個部署的模型啟用Vertex Explainability
最小/最大副本數根據請求率自動擴展
GPU分配為每次部署指定GPU類型(NVIDIA T4、A100)

考試提示: Vertex AI Endpoints的流量分割是實作金絲雀部署或A/B測試的方式。題目問「安全推出新模型版本」→ 流量分割(例如:90%舊版、10%新版)。

3. 批次預測

屬性值
輸入Cloud Storage(CSV、JSON、JSONL、TFRecords、Avro)
輸出Cloud Storage(JSON/CSV格式的預測結果)
不需要端點直接從Model Registry執行,不需要持久化端點
自動擴展完成後縮減至零(成本效益高)
加速器支援GPU/TPU進行批次推論

4. 模型版本管理與Registry

Vertex AI Model Registry:

Model: churn-predictor
├── v1 (Logistic Regression)  ← Champion in production
│   - Accuracy: 0.87
│   - Deployed to: endpoint/prod (70% traffic)
│
└── v2 (XGBoost)              ← Challenger
    - Accuracy: 0.91
    - Deployed to: endpoint/prod (30% traffic)

After validation: promote v2 to Champion

5. 邊緣部署

平台解決方案
行動裝置(Android/iOS)TFLite + Vertex AI模型匯出
邊緣裝置(IoT)TFLite Micro / Edge TPU(Coral)
本地伺服器Docker容器中的TF Serving
KubernetesGKE上的KServe(前身KFServing)

6. 練習題

Q1: 一家公司需要對5,000萬筆客戶記錄進行流失風險評分。結果需要在2小時內完成,但不需要即時。哪種Vertex AI預測選項最具成本效益?

  • A) 高副本數的線上預測
  • B) 批次預測 ✓
  • C) 透過Dataflow的串流預測
  • D) 部署在專用GPU端點上

解說:批次預測專為大規模非同步評分設計。在工作期間擴展運算資源,完成後縮減至零,無持久化端點成本。既然不需要即時回應,線上預測會是浪費。

Q2: 團隊正在部署新的模型版本。他們想逐步將10%的生產流量路由到新版本,而舊版本處理90%,在全面推出前比較效能指標。哪個Vertex AI功能實現此目的?

  • A) Model Registry版本管理
  • B) Vertex AI Endpoints流量分割 ✓
  • C) 批次預測比較
  • D) Vertex AI Experiments

解說:Vertex AI Endpoints支援同時部署多個模型版本,配合可設定的流量分割(例如90%/10%)。這使得金絲雀部署和A/B測試能夠在全面推出前比較即時效能。

Q3: 一家零售公司想在沒有雲端網路連線的工廠車間偵測產品缺陷。應使用哪種部署方式?

  • A) Vertex AI線上預測端點
  • B) 使用TFLite部署到裝置的AutoML Edge Model ✓
  • C) BigQuery ML批次預測
  • D) Cloud Run上的TF Serving

解說:使用TFLite(或AutoML Edge Model)的邊緣部署可以在裝置上本地執行推論,不需要網路連線。TFLite支援電腦視覺模型的裝置端推論,適合沒有網路的工廠車間設備。