Chuyển đến nội dung chính

第3課:生成式AI與基礎模型

什麼是生成式AI。基礎模型:預訓練、微調。 類型:文字轉文字、文字轉圖像、文字轉程式碼。分詞。 模型參數、推論、temperature、top-p、top-k。

基礎模型生命週期

基礎模型生命週期 — 預訓練、微調、RAG和提示工程

領域2概覽

領域2佔考試的24% — 這是第二大領域。您需要對生成式AI、基礎模型以及它們與傳統ML的區別有扎實的理解。

1. 什麼是生成式AI?

生成式AI是AI的一個分支,專注於基於從訓練資料中學習的模式創建新內容(文字、圖像、程式碼、音訊、影片)。

判別式AI vs 生成式AI

面向判別式AI生成式AI
功能分類/預測創建/生成
輸出標籤、類別、數值新內容(文字、圖像、程式碼)
範例「這封郵件是垃圾郵件嗎?」→ 是/否「寫一封關於...的郵件」→ 新郵件
模型邏輯迴歸、SVM、CNN分類器GPT、Claude、Stable Diffusion、DALL-E

生成式AI模態

輸入 → 輸出範例模型
文字 → 文字聊天機器人、摘要、翻譯GPT-4、Claude、Llama
文字 → 圖像從描述生成圖像DALL-E、Stable Diffusion、Titan Image Generator
文字 → 程式碼程式碼生成、除錯CodeWhisperer、Copilot
文字 → 音訊語音合成、音樂生成Amazon Polly(TTS)
圖像 → 文字圖像描述、視覺問答Claude(多模態)、GPT-4V
音訊 → 文字轉錄Amazon Transcribe、Whisper

2. 基礎模型

基礎模型(FM)是一種非常大的AI模型,已在大規模資料集上預訓練,可以適應許多不同的下游任務。

關鍵特性

  • 大規模預訓練:在數十億資料點上訓練(互聯網文字、書籍、程式碼)
  • 通用型:無需特定任務訓練即可處理多種任務
  • 可適應:可通過微調或提示適應特定用例
  • 訓練成本高:需要大規模運算(GPU/TPU集群)
  • 通過API存取:用戶不需要訓練 — 通過API使用(Amazon Bedrock)

基礎模型生命週期

┌─────────────────┐     ┌──────────────┐     ┌──────────────┐
│ 1. 預訓練        │────→│ 2. 微調       │────→│ 3. 推論       │
│ (大規模資料、    │     │ (適應特定    │     │ (通過API或   │
│  數十億參數、     │     │  領域)       │     │  端點使用     │
│  非常昂貴)       │     │              │     │  模型)       │
└─────────────────┘     └──────────────┘     └──────────────┘
     模型提供者              您/組織              用戶
   (Anthropic、Meta、                      (應用程式)
    Amazon等)

3. 分詞

分詞是將文字分成模型可以理解的小單位(token)的過程。

輸入:  "Machine learning is amazing!"
Token:["Machine", " learning", " is", " amazing", "!"]
         token_1    token_2      token_3  token_4    token_5

或(子詞分詞):
Token:["Mach", "ine", " learn", "ing", " is", " amaz", "ing", "!"]

考試關鍵概念:

  • Token ≠ 詞:一個token可以是詞的一部分、整個詞或標點符號
  • 上下文視窗:模型一次可以處理的最大token數(輸入 + 輸出)
  • Token限制:決定模型可以「看到」和生成多少文字
  • 定價:API呼叫通常按token計價(輸入token + 輸出token)

考試提示:上下文視窗大小很重要。較大的上下文 = 可以處理更長的文件。但成本更高,可能更慢。

4. 模型參數與推論設定

4.1. 模型參數(訓練期間學習)

  • 參數 = 神經網路中的權重和偏差
  • GPT-4:約1.7兆參數,Claude:未公開,Llama 3:8B/70B/405B
  • 更多參數 → 通常更強大,但成本更高

4.2. 推論參數(由用戶設定)

呼叫模型時,您可以調整推論參數:

參數範圍控制內容
Temperature0.0 → 1.0+隨機性/創造性。低 = 確定性、集中。高 = 創造性、多樣。
Top-p(核採樣)0.0 → 1.0累積機率閾值。較低 = 更集中的詞彙。
Top-k1 → ∞要考慮的前k個token。較低 = 更可預測。
最大token數1 → 限制生成輸出的最大長度。
停止序列字串告訴模型停止生成的文字。

考試Temperature指南

Temperature = 0  →  最確定性(事實問答、程式碼、資料擷取)
Temperature = 0.3 → 略有創造性(商業寫作、摘要)
Temperature = 0.7 → 有創造性(故事、腦力激盪、行銷文案)
Temperature = 1.0+ → 非常隨機(詩歌、創意寫作 — 可能更多幻覺)

考試提示:「一家公司需要一致、準確的客戶FAQ回答」→ 使用低temperature。「一家公司需要創意行銷口號」→ 使用高temperature。

5. 幻覺

幻覺是模型生成自信但不正確的輸出 — 捏造事實、引用或不存在的資訊。

原因:

  • 訓練資料的缺口或過時資訊
  • 模型並非真正「知道」事實 — 它預測可能的下一個token
  • 模糊或太開放的提示
  • 高temperature設定

緩解策略:

策略如何幫助
RAG(檢索增強生成)基於知識庫中的實際資料來回答
降低temperature減少生成的隨機性
護欄過濾/驗證輸出(Amazon Bedrock Guardrails)
更好的提示「只根據提供的上下文回答」/「不確定就說不知道」
微調用特定領域的準確資料訓練模型
人工審查人機協作驗證

6. AWS上的基礎模型(Amazon Bedrock)

Amazon Bedrock提供來自多個供應商的多種基礎模型:

供應商模型優勢
AnthropicClaude 3(Haiku、Sonnet、Opus)推理、安全性、長上下文
MetaLlama 3開源、多用途
AmazonTitan(Text、Embeddings、Image)AWS原生、RAG用嵌入向量
Mistral AIMistral、Mixtral高效、快速推論
Stability AIStable Diffusion圖像生成
CohereCommand、Embed企業NLP、嵌入向量
AI21 LabsJurassic文字生成

7. 練習題

Q1:與傳統ML模型相比,基礎模型的主要優勢是什麼?

  • A) 它們更小更快
  • B) 它們可以無需特定任務訓練即可適應多種下游任務 ✓
  • C) 它們從不產生錯誤的輸出
  • D) 它們不需要任何運算資源

解說:基礎模型在大規模資料集上預訓練,可以通過提示或微調適應多種不同任務。它們很大,可能會產生幻覺,仍然需要運算資源。

Q2:一家公司使用生成式AI模型,注意到它有時會生成看似合理但事實不正確的資訊。這種現象叫什麼?

  • A) 過擬合
  • B) 資料漂移
  • C) 幻覺 ✓
  • D) 偏差

解說:幻覺是指生成式AI模型產生自信但事實不正確的輸出。

Q3:一位開發人員想確保其生成式AI聊天機器人提供一致、事實性的回答,並盡量減少創造性。他們應該調整哪個推論參數?

  • A) 將最大token數設得很高
  • B) 將temperature設為接近0 ✓
  • C) 將temperature設為接近1
  • D) 增加top-k值

解說:低temperature使模型更確定性和集中,減少回答的創造性和隨機性。