Chuyển đến nội dung chính

第一課:什麼是生成式人工智慧? — 創意人工智慧景觀

產生人工智慧的定義,區分判別模型與生成模型。從玻爾茲曼機到擴散模型的發展歷史。生成模型的類型:GAN、VAE、基於流、擴散、自回歸。 2026 年的現實應用與當前情勢。

🧠 人工智慧與機器學習 — 第 0 課 第一課:什麼是生成式人工智慧? — 人工智慧全景 創造力

生成式 AI:使用 AI 創建圖像和視頻

第 1 部分:生成式 AI 平台 — 理論與架構

亞洲開發網

簡介

生成式人工智慧是人工智慧的一個分支,它能夠生成新內容——圖像、視訊、聲音、文字、程式碼——而不僅僅是分類或預測。這是從「認知」AI到「創意」AI的飛躍。

💡 歧視模型 回答“這是什麼?” — 生成模型回答“如何創建新模型?”


1. 判別模型與生成模型

┌──────────────────────────────────────────────────────────┐
│              DISCRIMINATIVE MODELS                        │
│   Input: x → P(y|x) → Label/Class                       │
│   "Ảnh này là mèo hay chó?"                             │
│   Ví dụ: CNN classifier, SVM, Logistic Regression       │
├──────────────────────────────────────────────────────────┤
│              GENERATIVE MODELS                            │
│   Noise z → P(x) → Synthetic Data                       │
│   "Tạo một ảnh mèo mới"                                │
│   Ví dụ: GAN, VAE, Diffusion, GPT                       │
└──────────────────────────────────────────────────────────┘
特質歧視生成
目標學習 P(y|x)學習 P(x) 或 P(x|z)
輸出標籤、分數新數據
範例ResNet、BERT 分類器GAN,穩定擴散
應用分類、偵測生成、合成

2. 生成式人工智慧的歷史

年份里程碑型號
2013VAE誕生金馬與威靈
2014GAN:「機器學習中最酷的想法」伊恩古德費洛
20152015 DCGAN:穩定的 GAN 訓練雷德福等人。
2018StyleGAN:逼真的臉英偉達
2020DDPM:擴散模型何等人。
2021DALL-E,剪輯開放人工智慧
20222022中途穩定擴散穩定性人工智慧
2023SDXL、DALL-E 3、中途 v5多
20242024索拉、通量、SD3OpenAI、BFL
2025 年 26 日視訊基因成熟,3D基因多

3. 分類-生成模型的類型

3.1 GAN — 生成對抗網絡

# Concept: 2 networks chơi game
# Generator: tạo fake data
# Discriminator: phân biệt real vs fake

# Generator
z = torch.randn(batch_size, latent_dim)  # random noise
fake_images = generator(z)  # tạo ảnh giả

# Discriminator
real_score = discriminator(real_images)  # → 1 (real)
fake_score = discriminator(fake_images)  # → 0 (fake)

# Training: Generator cố gắng "lừa" Discriminator

3.2 VAE——變分自動編碼器

# Concept: Encode → Latent Space → Decode
# Input image → encoder → μ, σ → sample z → decoder → reconstructed image

# Ưu điểm: latent space có cấu trúc, có thể interpolation
# Nhược điểm: ảnh thường bị blurry

3.3 擴散模型

# Concept: Thêm noise dần → Học cách bỏ noise
# Forward: image → noisy → noisier → ... → pure noise
# Reverse: pure noise → less noisy → ... → clean image

# Ưu điểm: chất lượng cao nhất hiện tại
# Nhược điểm: chậm hơn GAN (nhiều steps)

3.4 自迴歸模型

# Concept: Tạo từng phần một, dựa vào context trước
# GPT: tạo text token by token
# PixelCNN: tạo image pixel by pixel
# DALL-E 1: text → image tokens (autoregressive)

3.5 基於流的模型

# Concept: Invertible transformations
# z → f1 → f2 → ... → x (exact likelihood)
# Normalizing Flows: RealNVP, Glow
# Ưu điểm: exact log-likelihood
# Nhược điểm: architecture constraints

4.生成式AI 2026實際應用

圖片生成

  • 行銷:創建廣告圖像、橫幅、產品模型
  • 設計:UI/UX 原型設計、概念藝術
  • 電子商務:產品攝影、虛擬試穿

影片生成

  • 內容創作:社群媒體影片、廣告
  • 教育:教材、模擬
  • 娛樂:SFX、動畫

3D 和空間

  • 遊戲:3D 資產生成
  • 建築:室內設計視覺化
  • AR/VR:虛擬環境

音訊和音樂

  • 播客:語音合成、編輯
  • 音樂:背景音樂、歌曲
  • 輔助使用:文字轉語音

5. 2026 年生成式人工智慧前景

┌──────────────────────────────────────────────────────┐
│                GENERATIVE AI STACK                    │
│                                                      │
│  ┌──────────────┐  ┌──────────────┐  ┌───────────┐  │
│  │   Text-to-   │  │  Text-to-    │  │ Text-to-  │  │
│  │    Image      │  │   Video      │  │   3D      │  │
│  │              │  │              │  │           │  │
│  │ • SD, SDXL  │  │ • Sora       │  │ • Point-E │  │
│  │ • DALL-E 3  │  │ • Runway     │  │ • Magic3D │  │
│  │ • Midjourney│  │ • Kling      │  │ • 3D GS   │  │
│  │ • Flux      │  │ • Pika       │  │           │  │
│  └──────────────┘  └──────────────┘  └───────────┘  │
│                                                      │
│  ┌──────────────────────────────────────────────┐    │
│  │            Foundation Models                  │    │
│  │  Diffusion Models, Transformers, GANs        │    │
│  └──────────────────────────────────────────────┘    │
│                                                      │
│  ┌──────────────────────────────────────────────┐    │
│  │            Infrastructure                     │    │
│  │  GPU Cloud, Model Serving, Storage           │    │
│  └──────────────────────────────────────────────┘    │
└──────────────────────────────────────────────────────┘

6.建置開發環境

# Tạo virtual environment
python -m venv genai-env
source genai-env/bin/activate

# Cài đặt core packages
pip install torch torchvision torchaudio
pip install diffusers transformers accelerate
pip install Pillow opencv-python matplotlib

# Verify GPU
python -c "import torch; print(f'CUDA: {torch.cuda.is_available()}')"
python -c "import diffusers; print(f'Diffusers: {diffusers.__version__}')"
# Quick test: generate image với Stable Diffusion
from diffusers import StableDiffusionPipeline
import torch

pipe = StableDiffusionPipeline.from_pretrained(
    "stabilityai/stable-diffusion-xl-base-1.0",
    torch_dtype=torch.float16,
    variant="fp16"
)
pipe.to("cuda")

image = pipe("a cat wearing sunglasses, digital art").images[0]
image.save("first_genai_image.png")
print("✅ Generated first image!")

總結

概念描述
生成式人工智慧AI創造新內容(圖像、視訊、音訊、文字)
甘生成器 vs 判别器 — 高级训练
VAE透過潛在空間編碼-解碼——結構化生成
擴散噪音 → 逐步降噪 — 最高品質
自迴歸部分順序產生-GPT、PixelCNN

📌 下一篇文章: 深入探討 GAN — 從零開始的生成對抗網路、訓練動態和重要變體。