簡介
生成式人工智慧是人工智慧的一個分支,它能夠生成新內容——圖像、視訊、聲音、文字、程式碼——而不僅僅是分類或預測。這是從「認知」AI到「創意」AI的飛躍。
💡 歧視模型 回答“這是什麼?” — 生成模型回答“如何創建新模型?”
1. 判別模型與生成模型
┌──────────────────────────────────────────────────────────┐
│ DISCRIMINATIVE MODELS │
│ Input: x → P(y|x) → Label/Class │
│ "Ảnh này là mèo hay chó?" │
│ Ví dụ: CNN classifier, SVM, Logistic Regression │
├──────────────────────────────────────────────────────────┤
│ GENERATIVE MODELS │
│ Noise z → P(x) → Synthetic Data │
│ "Tạo một ảnh mèo mới" │
│ Ví dụ: GAN, VAE, Diffusion, GPT │
└──────────────────────────────────────────────────────────┘
| 特質 | 歧視 | 生成 |
|---|---|---|
| 目標 | 學習 P(y|x) | 學習 P(x) 或 P(x|z) |
| 輸出 | 標籤、分數 | 新數據 |
| 範例 | ResNet、BERT 分類器 | GAN,穩定擴散 |
| 應用 | 分類、偵測 | 生成、合成 |
2. 生成式人工智慧的歷史
| 年份 | 里程碑 | 型號 |
|---|---|---|
| 2013 | VAE誕生 | 金馬與威靈 |
| 2014 | GAN:「機器學習中最酷的想法」 | 伊恩古德費洛 |
| 2015 | 2015 DCGAN:穩定的 GAN 訓練 | 雷德福等人。 |
| 2018 | StyleGAN:逼真的臉 | 英偉達 |
| 2020 | DDPM:擴散模型 | 何等人。 |
| 2021 | DALL-E,剪輯 | 開放人工智慧 |
| 2022 | 2022中途穩定擴散 | 穩定性人工智慧 |
| 2023 | SDXL、DALL-E 3、中途 v5 | 多 |
| 2024 | 2024索拉、通量、SD3 | OpenAI、BFL |
| 2025 年 26 日 | 視訊基因成熟,3D基因 | 多 |
3. 分類-生成模型的類型
3.1 GAN — 生成對抗網絡
# Concept: 2 networks chơi game
# Generator: tạo fake data
# Discriminator: phân biệt real vs fake
# Generator
z = torch.randn(batch_size, latent_dim) # random noise
fake_images = generator(z) # tạo ảnh giả
# Discriminator
real_score = discriminator(real_images) # → 1 (real)
fake_score = discriminator(fake_images) # → 0 (fake)
# Training: Generator cố gắng "lừa" Discriminator
3.2 VAE——變分自動編碼器
# Concept: Encode → Latent Space → Decode
# Input image → encoder → μ, σ → sample z → decoder → reconstructed image
# Ưu điểm: latent space có cấu trúc, có thể interpolation
# Nhược điểm: ảnh thường bị blurry
3.3 擴散模型
# Concept: Thêm noise dần → Học cách bỏ noise
# Forward: image → noisy → noisier → ... → pure noise
# Reverse: pure noise → less noisy → ... → clean image
# Ưu điểm: chất lượng cao nhất hiện tại
# Nhược điểm: chậm hơn GAN (nhiều steps)
3.4 自迴歸模型
# Concept: Tạo từng phần một, dựa vào context trước
# GPT: tạo text token by token
# PixelCNN: tạo image pixel by pixel
# DALL-E 1: text → image tokens (autoregressive)
3.5 基於流的模型
# Concept: Invertible transformations
# z → f1 → f2 → ... → x (exact likelihood)
# Normalizing Flows: RealNVP, Glow
# Ưu điểm: exact log-likelihood
# Nhược điểm: architecture constraints
4.生成式AI 2026實際應用
圖片生成
- 行銷:創建廣告圖像、橫幅、產品模型
- 設計:UI/UX 原型設計、概念藝術
- 電子商務:產品攝影、虛擬試穿
影片生成
- 內容創作:社群媒體影片、廣告
- 教育:教材、模擬
- 娛樂:SFX、動畫
3D 和空間
- 遊戲:3D 資產生成
- 建築:室內設計視覺化
- AR/VR:虛擬環境
音訊和音樂
- 播客:語音合成、編輯
- 音樂:背景音樂、歌曲
- 輔助使用:文字轉語音
5. 2026 年生成式人工智慧前景
┌──────────────────────────────────────────────────────┐
│ GENERATIVE AI STACK │
│ │
│ ┌──────────────┐ ┌──────────────┐ ┌───────────┐ │
│ │ Text-to- │ │ Text-to- │ │ Text-to- │ │
│ │ Image │ │ Video │ │ 3D │ │
│ │ │ │ │ │ │ │
│ │ • SD, SDXL │ │ • Sora │ │ • Point-E │ │
│ │ • DALL-E 3 │ │ • Runway │ │ • Magic3D │ │
│ │ • Midjourney│ │ • Kling │ │ • 3D GS │ │
│ │ • Flux │ │ • Pika │ │ │ │
│ └──────────────┘ └──────────────┘ └───────────┘ │
│ │
│ ┌──────────────────────────────────────────────┐ │
│ │ Foundation Models │ │
│ │ Diffusion Models, Transformers, GANs │ │
│ └──────────────────────────────────────────────┘ │
│ │
│ ┌──────────────────────────────────────────────┐ │
│ │ Infrastructure │ │
│ │ GPU Cloud, Model Serving, Storage │ │
│ └──────────────────────────────────────────────┘ │
└──────────────────────────────────────────────────────┘
6.建置開發環境
# Tạo virtual environment
python -m venv genai-env
source genai-env/bin/activate
# Cài đặt core packages
pip install torch torchvision torchaudio
pip install diffusers transformers accelerate
pip install Pillow opencv-python matplotlib
# Verify GPU
python -c "import torch; print(f'CUDA: {torch.cuda.is_available()}')"
python -c "import diffusers; print(f'Diffusers: {diffusers.__version__}')"
# Quick test: generate image với Stable Diffusion
from diffusers import StableDiffusionPipeline
import torch
pipe = StableDiffusionPipeline.from_pretrained(
"stabilityai/stable-diffusion-xl-base-1.0",
torch_dtype=torch.float16,
variant="fp16"
)
pipe.to("cuda")
image = pipe("a cat wearing sunglasses, digital art").images[0]
image.save("first_genai_image.png")
print("✅ Generated first image!")
總結
| 概念 | 描述 |
|---|---|
| 生成式人工智慧 | AI創造新內容(圖像、視訊、音訊、文字) |
| 甘 | 生成器 vs 判别器 — 高级训练 |
| VAE | 透過潛在空間編碼-解碼——結構化生成 |
| 擴散 | 噪音 → 逐步降噪 — 最高品質 |
| 自迴歸 | 部分順序產生-GPT、PixelCNN |
📌 下一篇文章: 深入探討 GAN — 從零開始的生成對抗網路、訓練動態和重要變體。