はじめに
ノートブックで実行される微調整されたモデル≠実稼働環境で実行されます。この記事では、展開戦略について説明します。
1. API ベースの導入 (最も簡単)
頂点 AI
# Model đã deploy tự động sau tuning job
response = client.models.generate_content(
model=tuned_model_name,
contents="Production query here"
)
OpenAI
response = client.chat.completions.create(
model="ft:gpt-4o-mini:org:name:id",
messages=[{"role": "user", "content": "Production query"}]
)
2. セルフホスト型の展開
LoRA をマージし、vLLM を使用してデプロイする
# Merge LoRA adapters into base model
python merge_adapters.py --base meta-llama/Llama-3-8B --adapter ./lora_output
# Serve with vLLM
python -m vllm.entrypoints.openai.api_server \
--model ./merged_model \
--host 0.0.0.0 --port 8000
3. モニタリング
# Track: latency, cost, quality drift
class InferenceMonitor:
def __init__(self):
self.metrics = []
def log(self, query, response, latency, cost):
self.metrics.append({
"timestamp": time.time(),
"latency_ms": latency,
"cost_usd": cost,
"response_length": len(response),
})
概要
- API デプロイ: シンプル、Vertex AI または OpenAI
- セルフホスト型: vLLM または TGI、最初に LoRA をマージする必要があります
- マルチアダプター: 1 つの基本モデルから複数の微調整されたバリアントを提供します
- モニタリング: 遅延、コスト、品質の変動
演習
- 微調整されたモデルをデプロイし、レイテンシーをテストします (ベースと FT)
- 推論監視ダッシュボードの実装
- 負荷テスト: 100 個の同時リクエスト
- セットアップ品質ドリフト検出