Chuyển đến nội dung chính

第 16 課:Capstone — 針對實際用例微調模型

總結項目:選擇用例→收集資料→在Gemini + LoRA上微調→比較評估→部署到生產。端到端的工作流程。

🧠 人工智慧與機器學習 — 第 15 課 第 16 課:Capstone — 微調模型以供使用 實際案例

微調 LLM:AI 調優的藝術

第 6 部分:生產和最佳實踐

亞洲開發網

簡介

總結如下—您將從 A → Z 建立一個端到端微調專案。


1. 項目:越南語代碼審查助理

架構

┌────────────────────────────────────────────────┐
│           FINE-TUNING PIPELINE                  │
│                                                │
│  Data Collection  → Data Cleaning → Training   │
│  (GitHub PRs,       (Dedup,         (Gemini    │
│   code reviews)     quality score)   Flash SFT)│
│                                                │
│  Evaluation → A/B Testing → Production Deploy  │
│  (ROUGE,      (Base vs FT,   (Vertex AI       │
│   LLM-Judge,   100 queries)   Endpoint)        │
│   Golden Set)                                  │
└────────────────────────────────────────────────┘

元件清單

  • 選擇用例並定義成功指標
  • 收集200+訓練實例
  • 資料清理與品質評分
  • 將 Gemini Flash (Vertex AI) 微調
  • 對開源進行微調(LoRA,用於比較)
  • 多層評估管道
  • 災難性遺忘檢查
  • A/B 測試基礎與微調
  • 成本分析與投資報酬率報告
  • 部署生產端點
  • 監控設定

2. 一步一步

第 1 階段:資料(2-4 小時)

  • 收集 200 多個範例
  • 清理、格式化、分割 (80/10/10)
  • 品質審查隨機20個樣品

第 2 階段:培訓(1-2 小時)

  • 在 Vertex AI 上微調 Gemini Flash
  • 微調 LLaMA с LoRA(比較)
  • 3 個實驗:第 2、3、5 紀元

第 3 階段:評估(2-3 小時)

  • 自動化指標:ROUGE、BERTScore
  • 法學碩士法官:50 個測試案例
  • 黃金測試集:30 個精選案例
  • 災難性遺忘:20 個一般問題

第 4 階段:製作(1 小時)

  • 部署最佳模型
  • 監控設定
  • 成本分析報告

3. 最佳實務總結

✅ DO:
- Start with prompt engineering (free!)
- Invest 70% time in data quality
- Use multi-layer evaluation
- Version control everything
- Calculate ROI before and after
- Monitor in production

❌ DON'T:
- Fine-tune without trying PE/RAG first
- Use raw, unclean data
- Evaluate by "vibes" — use metrics
- Ignore catastrophic forgetting
- Skip A/B testing
- Forget about ongoing maintenance cost

🎉 恭喜!

您已完成微調法學碩士:人工智慧調優的藝術!您可以:

  1. 正確的決定:微調、RAG 與即時工程
  2. 在3個平台上微調:Google Gemini、OpenAI、LoRA開源
  3. 科學評估:BLEU、ROUGE、BERTScore、LLM-as-Judge、Human Eval
  4. 成本計算:投資報酬率計算器、預算規劃、成本最佳化
  5. 部署生產:監控、A/B 測試、偏差檢測

最後練習

  1. 完成端到端頂點項目
  2. 撰寫包含特定指標的評估報告(3頁以上)
  3. 發布模型或與社群分享研究結果
  4. 確定下一個需要微調的用例