Chuyển đến nội dung chính

講義 48: AI/ML ワークロードのための Kubernetes

Kubernetes AI/ML 2026: DRA (動的リソース割り当て) GA K8s 1.34 を使用した GPU スケジューリング、タイム スライシング、MIG パーティショニング。 Kubernetes Inference Extension (KIE)、KEDA スケール トゥ ゼロ、ResourceFlavor、Kueue バッチ スケジューリング。

🔒 DevSecOps — レッスン 48 レッスン 48: AI/ML ワークロード用の KUBERNETES

KUBERNETES: 基本から高度まで

モジュール 10: クラウドと制作_

xdev.asia_

🎯 レッスンの目的

Kubernetes 2026 が AI/ML ワークロードをどのようにサポートしているかを理解します: DRA による GPU スケジューリング、KIE による推論処理、Kueue と JobSet によるバッチ トレーニング、リクエスト キューによる自動スケーリング。

1. AI/ML に Kubernetes を使用する理由

  • サービスとしての GPU: 複数のチームで GPU クラスターを共有
  • ゼロにスケール: 推論サーバーがリクエストを受信しない → ポッドが 0 に減少し、GPU を節約
  • バッチ スケジュール: トレーニング ジョブはキューに入れられ、効率的にスケジュールされます
  • 再現性: コンテナイメージにより一貫した環境が確保されます
  • マルチクラウドの移植性: GPU を使用して任意のクラウドでトレーニングを実行

2. GPU スケジューリング — 動的リソース割り当て (DRA) GA K8s 1.34

DRA は古いデバイス プラグイン API を置き換え、より柔軟な GPU 共有を可能にします:

___コードブロック_0___ ___コードブロック_1___ ___コードブロック_2___

3. GPU タイム スライシングと MIG

___コードブロック_3___

4. Kubernetes 推論拡張機能 (KIE)

KIE (2025 CNCF プロジェクト): Kubernetes で提供される LLM 推論の標準化:

___コードブロック_4___ ___コードブロック_5___ ___コードブロック_6___

5. Kueue — バッチジョブのスケジュール

Kueue (CNCF): バッチ ワークロードの公平なキューイング (トレーニング ジョブ、データ処理):

___コードブロック_7___ ___コードブロック_8___ ___コードブロック_9___ ___コードブロック_10___

6. KEDA — 推論のためにゼロにスケール

___コードブロック_11___

7. K8s 2026 上の AI/ML スタックの概要

___コードブロック_12___

概要

  • DRA GA K8s 1.34: 柔軟な GPU 共有、デバイス プラグイン API の置き換え
  • MIG: より強力な分離のためのハードウェア パーティショニング A100/H100__HTMLTAG_117___
  • Kueue: GPU クラスターの公平なバッチ スケジューリング、チームごとのクォータ
  • KIE: キャッシュ認識プレフィックス__HTMLTAG_121___ を使用したインテリジェントな LLM 推論ルーティング
  • KEDA: アイドル時に推論サーバーを 0 にスケール → GPU コストを節約