Chuyển đến nội dung chính

レッスン 11: GPT と自己回帰モデル — 生成事前トレーニング済みトランスフォーマー

GPT アーキテクチャ: 因果言語モデリング。 GPT-1→GPT-2→GPT-3→GPT-4の進化。自己回帰生成: 温度、top-k、top-p サンプリング。創発的な能力。文脈に沿った学習。 BERT (エンコーダー)、GPT (デコーダー)、T5 (エンコーダー-デコーダー) を比較します。

🧠 AI と ML — レッスン 10 レッスン 11: GPT と自己回帰モデル — 事前にトレーニングされた生成トランスフォーマー

NLP の基礎から上級まで: 自然言語処理をマスターする

パート 4: 事前トレーニングされた言語モデル — BERT、GPT、その他

xdev.asia

はじめに

BERT がテキストを 2 方向から「読み取る」場合、GPT はテキストを左から右に「書き込み」ます (自己回帰生成)。 GPT は、世界を変えている LLM である ChatGPT、Claude、Gemini の基盤です。


1. GPT アーキテクチャ: デコーダのみ

Input:  "Once upon a time"
         │      │     │    │
         ▼      ▼     ▼    ▼
    ┌──────────────────────────┐
    │   Transformer Decoder    │
    │   (Causal Self-Attention)│
    │    Chỉ nhìn bên trái!   │
    └──────────────────────────┘
         │      │     │    │
         ▼      ▼     ▼    ▼
       "upon"  "a"  "time" ","

因果言語モデリング

$$P(x_1, x_2, ..., x_n) = \prod_{i=1}^{n} P(x_i | x_1, ..., x_{i-1})$$

このモデルは、以前のすべてのトークンに基づいて次のトークンを予測します (将来は考慮しません)。


2. 進化: GPT-1 → GPT-4

モデル年パラメータトレーニングデータブレークスルー
GPT-12018年117Mブックコーパス生成的な事前トレーニング作品
GPT-22019年1.5Bウェブテキスト (40GB)「危険すぎて解放できない」
GPT-32020年175B570GB テキスト状況に応じた学習、少数ショット
GPT-42023年~1.8T (噂)インターネット規模マルチモーダル、推論
GPT-4o2024年未公開+ 画像、音声ネイティブマルチモーダル

3. デコード戦略

温度、トップ k、トップ p

from transformers import GPT2LMHeadModel, GPT2Tokenizer

tokenizer = GPT2Tokenizer.from_pretrained("gpt2")
model = GPT2LMHeadModel.from_pretrained("gpt2")

input_text = "Artificial intelligence will"
input_ids = tokenizer.encode(input_text, return_tensors="pt")

# Greedy (deterministic, boring)
greedy = model.generate(input_ids, max_length=50, do_sample=False)

# Temperature sampling (creativity control)
creative = model.generate(
    input_ids, max_length=50,
    do_sample=True,
    temperature=0.8,   # < 1: focused, > 1: creative
    top_k=50,          # Chỉ xét 50 tokens có probability cao nhất
    top_p=0.9,         # Nucleus sampling: 90% probability mass
)

print(tokenizer.decode(creative[0]))
パラメータ低い曹操
温度正確で再現性のあるクリエイティブ、ランダム
トップk選択肢は少なく、安全多くの多様なオプション
トップトークンに確実に焦点を当てるより多くのトークンを検討してください

4. コンテキスト内学習 (ICL)

GPT-3 は次のことを発見しました。微調整の必要はなく、プロンプトに例を入力するだけです。

prompt = """
Classify the sentiment:
Text: "This movie is amazing!" → Positive
Text: "Terrible experience" → Negative
Text: "The food was okay" → Neutral
Text: "I absolutely love this product!" →"""

# GPT sẽ trả lời: "Positive"
# Không cần fine-tune! Chỉ cần prompt engineering.
パラダイム例微調整?
ゼロショット例はありませんいいえ
ワンショット1 例いいえ
数ショット3-10 例いいえ
微調整数千の例はい

5. BERT 対 GPT 対 T5

特長BERT (エンコーダー)GPT (デコーダー)T5 (Enc-Dec)
方向双方向左から右両方
事前トレーニングMLM + NSPコーザルLMノイズ除去
良いこと分類、NER、QA生成、チャットすべて (テキストからテキストへ)
例ロバート・フォバートGPT-4、LLaMAT5、mT5、ViT5

概要

コンセプト詳細
GPTデコーダのみ、因果的 LM、自己回帰
スケーリングの法則より大きなモデル + より多くのデータ = より良いパフォーマンス
デコード温度、top-k、top-p 制御出力ダイバーシティ
ICL微調整なしの数ショット学習
BERT 対 GPT理解 (BERT) と生成 (GPT)

次の記事

レッスン 12: ハグフェイス エコシステム — 最もよく使用されるライブラリ (トランスフォーマー、データセット、トークナイザー) を使用して最新の NLP を練習します。