簡介
總結如下—您將從 A → Z 建立一個端到端微調專案。
1. 項目:越南語代碼審查助理
架構
┌────────────────────────────────────────────────┐
│ FINE-TUNING PIPELINE │
│ │
│ Data Collection → Data Cleaning → Training │
│ (GitHub PRs, (Dedup, (Gemini │
│ code reviews) quality score) Flash SFT)│
│ │
│ Evaluation → A/B Testing → Production Deploy │
│ (ROUGE, (Base vs FT, (Vertex AI │
│ LLM-Judge, 100 queries) Endpoint) │
│ Golden Set) │
└────────────────────────────────────────────────┘
元件清單
- 選擇用例並定義成功指標
- 收集200+訓練實例
- 資料清理與品質評分
- 將 Gemini Flash (Vertex AI) 微調
- 對開源進行微調(LoRA,用於比較)
- 多層評估管道
- 災難性遺忘檢查
- A/B 測試基礎與微調
- 成本分析與投資報酬率報告
- 部署生產端點
- 監控設定
2. 一步一步
第 1 階段:資料(2-4 小時)
- 收集 200 多個範例
- 清理、格式化、分割 (80/10/10)
- 品質審查隨機20個樣品
第 2 階段:培訓(1-2 小時)
- 在 Vertex AI 上微調 Gemini Flash
- 微調 LLaMA с LoRA(比較)
- 3 個實驗:第 2、3、5 紀元
第 3 階段:評估(2-3 小時)
- 自動化指標:ROUGE、BERTScore
- 法學碩士法官:50 個測試案例
- 黃金測試集:30 個精選案例
- 災難性遺忘:20 個一般問題
第 4 階段:製作(1 小時)
- 部署最佳模型
- 監控設定
- 成本分析報告
3. 最佳實務總結
✅ DO:
- Start with prompt engineering (free!)
- Invest 70% time in data quality
- Use multi-layer evaluation
- Version control everything
- Calculate ROI before and after
- Monitor in production
❌ DON'T:
- Fine-tune without trying PE/RAG first
- Use raw, unclean data
- Evaluate by "vibes" — use metrics
- Ignore catastrophic forgetting
- Skip A/B testing
- Forget about ongoing maintenance cost
🎉 恭喜!
您已完成微調法學碩士:人工智慧調優的藝術!您可以:
- 正確的決定:微調、RAG 與即時工程
- 在3個平台上微調:Google Gemini、OpenAI、LoRA開源
- 科學評估:BLEU、ROUGE、BERTScore、LLM-as-Judge、Human Eval
- 成本計算:投資報酬率計算器、預算規劃、成本最佳化
- 部署生產:監控、A/B 測試、偏差檢測
最後練習
- 完成端到端頂點項目
- 撰寫包含特定指標的評估報告(3頁以上)
- 發布模型或與社群分享研究結果
- 確定下一個需要微調的用例