🎯 レッスンの目的
Kubernetes 2026 が AI/ML ワークロードをどのようにサポートしているかを理解します: DRA による GPU スケジューリング、KIE による推論処理、Kueue と JobSet によるバッチ トレーニング、リクエスト キューによる自動スケーリング。
1. AI/ML に Kubernetes を使用する理由
- サービスとしての GPU: 複数のチームで GPU クラスターを共有
- ゼロにスケール: 推論サーバーがリクエストを受信しない → ポッドが 0 に減少し、GPU を節約
- バッチ スケジュール: トレーニング ジョブはキューに入れられ、効率的にスケジュールされます
- 再現性: コンテナイメージにより一貫した環境が確保されます
- マルチクラウドの移植性: GPU を使用して任意のクラウドでトレーニングを実行
2. GPU スケジューリング — 動的リソース割り当て (DRA) GA K8s 1.34
DRA は古いデバイス プラグイン API を置き換え、より柔軟な GPU 共有を可能にします:
___コードブロック_0___ ___コードブロック_1___ ___コードブロック_2___3. GPU タイム スライシングと MIG
___コードブロック_3___4. Kubernetes 推論拡張機能 (KIE)
KIE (2025 CNCF プロジェクト): Kubernetes で提供される LLM 推論の標準化:
___コードブロック_4___ ___コードブロック_5___ ___コードブロック_6___5. Kueue — バッチジョブのスケジュール
Kueue (CNCF): バッチ ワークロードの公平なキューイング (トレーニング ジョブ、データ処理):
___コードブロック_7___ ___コードブロック_8___ ___コードブロック_9___ ___コードブロック_10___6. KEDA — 推論のためにゼロにスケール
___コードブロック_11___7. K8s 2026 上の AI/ML スタックの概要
___コードブロック_12___概要
- DRA GA K8s 1.34: 柔軟な GPU 共有、デバイス プラグイン API の置き換え
- MIG: より強力な分離のためのハードウェア パーティショニング A100/H100__HTMLTAG_117___
- Kueue: GPU クラスターの公平なバッチ スケジューリング、チームごとのクォータ
- KIE: キャッシュ認識プレフィックス__HTMLTAG_121___ を使用したインテリジェントな LLM 推論ルーティング
- KEDA: アイドル時に推論サーバーを 0 にスケール → GPU コストを節約