Chuyển đến nội dung chính

レッスン 16: Capstone — 実際のユースケースに合わせてモデルを微調整する

プロジェクトの概要: ユースケースの選択 → データ収集 → Gemini + LoRA での微調整 → 比較評価 → 本番環境へのデプロイ。エンドツーエンドのワークフロー。

🧠 AI と ML — レッスン 15 レッスン 16: キャップストーン — 使用するモデルを微調整する 実際の事例

LLM の微調整: AI チューニングの技術

パート 6: 制作とベストプラクティス

xdev.asia

はじめに

概要は次のとおりです。エンドツーエンドの微調整プロジェクトを A → Z から構築します。


1. プロジェクト: ベトナム語コードレビューアシスタント

アーキテクチャ

┌────────────────────────────────────────────────┐
│           FINE-TUNING PIPELINE                  │
│                                                │
│  Data Collection  → Data Cleaning → Training   │
│  (GitHub PRs,       (Dedup,         (Gemini    │
│   code reviews)     quality score)   Flash SFT)│
│                                                │
│  Evaluation → A/B Testing → Production Deploy  │
│  (ROUGE,      (Base vs FT,   (Vertex AI       │
│   LLM-Judge,   100 queries)   Endpoint)        │
│   Golden Set)                                  │
└────────────────────────────────────────────────┘

コンポーネントのチェックリスト

  • ユースケースを選択し、成功指標を定義します
  • 200 以上のトレーニング例を収集
  • データクリーニングと品質スコアリング
  • Gemini Flash (Vertex AI) の微調整
  • オープンソースでの微調整 (LoRA、比較用)
  • マルチレイヤー評価パイプライン
  • 壊滅的な物忘れチェック
  • A/B テストのベースと微調整
  • コスト分析と ROI レポート
  • 実稼働エンドポイントをデプロイします
  • 監視設定

2. ステップバイステップ

フェーズ 1: データ (2 ~ 4 時間)

  • 200 以上の例を収集
  • クリーン、フォーマット、分割 (80/10/10)
  • 品質レビューのランダムな 20 サンプル

フェーズ 2: トレーニング (1 ~ 2 時間)

  • Vertex AI で Gemini Flash を微調整
  • LLaMA と LoRA の微調整 (比較)
  • 3 つの実験: エポック 2、3、5

フェーズ 3: 評価 (2 ~ 3 時間)

  • 自動化されたメトリクス: ROUGE、BERTScore
  • 裁判官としての LLM: 50 のテスト ケース
  • ゴールデン テスト セット: 厳選された 30 ケース
  • 壊滅的な物忘れ: 20 の一般的な質問

フェーズ 4: 実稼働 (1 時間)

  • 最適なモデルを導入する
  • 監視設定
  • コスト分析レポート

3. ベストプラクティスのまとめ

✅ DO:
- Start with prompt engineering (free!)
- Invest 70% time in data quality
- Use multi-layer evaluation
- Version control everything
- Calculate ROI before and after
- Monitor in production

❌ DON'T:
- Fine-tune without trying PE/RAG first
- Use raw, unclean data
- Evaluate by "vibes" — use metrics
- Ignore catastrophic forgetting
- Skip A/B testing
- Forget about ongoing maintenance cost

🎉 おめでとうございます!

LLM の微調整: AI チューニングの技術 を完了しました。次のことができます。

  1. 正しい決定: 微調整 vs RAG vs 迅速なエンジニアリング
  2. 3 つのプラットフォームで微調整: Google Gemini、OpenAI、LoRA オープンソース
  3. 科学的評価: BLEU、ROUGE、BERTScore、LLM-as-Judge、人間評価
  4. コスト計算: ROI 計算、予算計画、コスト最適化
  5. 本番環境の展開: モニタリング、A/B テスト、ドリフト検出

最後の演習

  1. エンドツーエンドのキャップストーン プロジェクトを完了する
  2. 特定の指標を含む評価レポート (3 ページ以上) を作成します。
  3. モデルを公開するか、コミュニティと結果を共有します
  4. 微調整する次のユースケースを特定する