Chuyển đến nội dung chính

レッスン 14: デプロイ — 微調整されたモデルを効果的に提供する

Vertex AI エンドポイント、OpenAI API、セルフホスト型 (vLLM、TGI) にデプロイされます。 LoRA アダプターをマージします。マルチアダプター対応。推論のモニタリング。

🧠 AI と ML — レッスン 13 レッスン 14: 導入 — 微調整されたサービスを提供する 効果的なモデル

LLM の微調整: AI チューニングの技術

パート 6: 制作とベストプラクティス

xdev.asia

はじめに

ノートブックで実行される微調整されたモデル≠実稼働環境で実行されます。この記事では、展開戦略について説明します。


1. API ベースの導入 (最も簡単)

頂点 AI

# Model đã deploy tự động sau tuning job
response = client.models.generate_content(
    model=tuned_model_name,
    contents="Production query here"
)

OpenAI

response = client.chat.completions.create(
    model="ft:gpt-4o-mini:org:name:id",
    messages=[{"role": "user", "content": "Production query"}]
)

2. セルフホスト型の展開

LoRA をマージし、vLLM を使用してデプロイする

# Merge LoRA adapters into base model
python merge_adapters.py --base meta-llama/Llama-3-8B --adapter ./lora_output

# Serve with vLLM
python -m vllm.entrypoints.openai.api_server \
    --model ./merged_model \
    --host 0.0.0.0 --port 8000

3. モニタリング

# Track: latency, cost, quality drift
class InferenceMonitor:
    def __init__(self):
        self.metrics = []
    
    def log(self, query, response, latency, cost):
        self.metrics.append({
            "timestamp": time.time(),
            "latency_ms": latency,
            "cost_usd": cost,
            "response_length": len(response),
        })

概要

  • API デプロイ: シンプル、Vertex AI または OpenAI
  • セルフホスト型: vLLM または TGI、最初に LoRA をマージする必要があります
  • マルチアダプター: 1 つの基本モデルから複数の微調整されたバリアントを提供します
  • モニタリング: 遅延、コスト、品質の変動

演習

  1. 微調整されたモデルをデプロイし、レイテンシーをテストします (ベースと FT)
  2. 推論監視ダッシュボードの実装
  3. 負荷テスト: 100 個の同時リクエスト
  4. セットアップ品質ドリフト検出