🎯課程目標___HTMLTAG_66__HTMLTAG_67___了解 Kubernetes 2026 如何支援 AI/ML 工作負載:使用 DRA 進行 GPU 調度、使用 KIE 進行推理服務、使用 Kueue 和 JobSet 進行批次訓練以及透過請求佇列訓練以及透過請求佇列進行大量訓練。
1。為什麼將 Kubernetes 用於 AI/ML?
-
___HTMLTAG_72__HTMLTAG_73___GPU 即服務:為多個團隊共享 GPU 叢集
___HTMLTAG_76__HTMLTAG_77___縮放到零:推理伺服器不接收請求→減少到 0 個 pod,節省 GPU
___HTMLTAG_80__HTMLTAG_81___批次排程:訓練作業有效排隊與排程
___HTMLTAG_84__HTMLTAG_85___可重複性:容器映像確保一致的環境
___HTMLTAG_88__HTMLTAG_89___多雲可移植性:使用 GPU 在任何雲端上執行訓練
2。 GPU 調度 — 動態資源分配 (DRA) GA K8s 1.34
DRA 取代了舊的裝置外掛程式 API,允許更靈活的 GPU 共享:
___程式碼區塊_0___ ___程式碼區塊_1___ ___程式碼區塊_2___3。 GPU 時間切片和 MIG
___程式碼區塊_3___4。 Kubernetes 推理擴充 (KIE)
KIE(2025 CNCF 項目):標準化 Kubernetes 上的 LLM 推理服務:
___程式碼區塊_4___ ___程式碼區塊_5___ ___程式碼區塊_6___5。 Kueue — 批次作業排程
Kueue (CNCF):批次工作負載的公平排隊(訓練作業、資料處理):
___程式碼區塊_7___ ___程式碼區塊_8___ ___程式碼區塊_9___ ___程式碼區塊_10___6。 KEDA — 推理縮放至零
___程式碼區塊_11___7。 K8s 2026 上的 AI/ML 堆疊概述
___程式碼區塊_12___摘要
- DRA GA K8s 1.34:靈活的 GPU 共享,取代裝置外掛程式 API
- MIG:硬體分區 A100/H100 以實現更強的隔離__HTMLTAG_117___
- Kueue:GPU 叢集的公平批次調度,每團隊配額
- KIE:具有快取感知前綴的智慧 LLM 推理路由__HTMLTAG_121___
- KEDA:空閒時將推理伺服器擴展到 0 → 節省 GPU 成本