はじめに
概要は次のとおりです。エンドツーエンドの微調整プロジェクトを A → Z から構築します。
1. プロジェクト: ベトナム語コードレビューアシスタント
アーキテクチャ
┌────────────────────────────────────────────────┐
│ FINE-TUNING PIPELINE │
│ │
│ Data Collection → Data Cleaning → Training │
│ (GitHub PRs, (Dedup, (Gemini │
│ code reviews) quality score) Flash SFT)│
│ │
│ Evaluation → A/B Testing → Production Deploy │
│ (ROUGE, (Base vs FT, (Vertex AI │
│ LLM-Judge, 100 queries) Endpoint) │
│ Golden Set) │
└────────────────────────────────────────────────┘
コンポーネントのチェックリスト
- ユースケースを選択し、成功指標を定義します
- 200 以上のトレーニング例を収集
- データクリーニングと品質スコアリング
- Gemini Flash (Vertex AI) の微調整
- オープンソースでの微調整 (LoRA、比較用)
- マルチレイヤー評価パイプライン
- 壊滅的な物忘れチェック
- A/B テストのベースと微調整
- コスト分析と ROI レポート
- 実稼働エンドポイントをデプロイします
- 監視設定
2. ステップバイステップ
フェーズ 1: データ (2 ~ 4 時間)
- 200 以上の例を収集
- クリーン、フォーマット、分割 (80/10/10)
- 品質レビューのランダムな 20 サンプル
フェーズ 2: トレーニング (1 ~ 2 時間)
- Vertex AI で Gemini Flash を微調整
- LLaMA と LoRA の微調整 (比較)
- 3 つの実験: エポック 2、3、5
フェーズ 3: 評価 (2 ~ 3 時間)
- 自動化されたメトリクス: ROUGE、BERTScore
- 裁判官としての LLM: 50 のテスト ケース
- ゴールデン テスト セット: 厳選された 30 ケース
- 壊滅的な物忘れ: 20 の一般的な質問
フェーズ 4: 実稼働 (1 時間)
- 最適なモデルを導入する
- 監視設定
- コスト分析レポート
3. ベストプラクティスのまとめ
✅ DO:
- Start with prompt engineering (free!)
- Invest 70% time in data quality
- Use multi-layer evaluation
- Version control everything
- Calculate ROI before and after
- Monitor in production
❌ DON'T:
- Fine-tune without trying PE/RAG first
- Use raw, unclean data
- Evaluate by "vibes" — use metrics
- Ignore catastrophic forgetting
- Skip A/B testing
- Forget about ongoing maintenance cost
🎉 おめでとうございます!
LLM の微調整: AI チューニングの技術 を完了しました。次のことができます。
- 正しい決定: 微調整 vs RAG vs 迅速なエンジニアリング
- 3 つのプラットフォームで微調整: Google Gemini、OpenAI、LoRA オープンソース
- 科学的評価: BLEU、ROUGE、BERTScore、LLM-as-Judge、人間評価
- コスト計算: ROI 計算、予算計画、コスト最適化
- 本番環境の展開: モニタリング、A/B テスト、ドリフト検出
最後の演習
- エンドツーエンドのキャップストーン プロジェクトを完了する
- 特定の指標を含む評価レポート (3 ページ以上) を作成します。
- モデルを公開するか、コミュニティと結果を共有します
- 微調整する次のユースケースを特定する