はじめに
生成 AI は、単なる分類や予測ではなく、新しいコンテンツ (画像、ビデオ、サウンド、テキスト、コード) を生成する機能を備えた AI の分野です。これは「認知型」AI から「創造型」AI への飛躍です。
💡 差別モデルは「これは何ですか?」と答えます。 — 生成モデル は、「新しいモデルを作成するにはどうすればよいですか?」に答えます。
1. 識別モデルと生成モデル
┌──────────────────────────────────────────────────────────┐
│ DISCRIMINATIVE MODELS │
│ Input: x → P(y|x) → Label/Class │
│ "Ảnh này là mèo hay chó?" │
│ Ví dụ: CNN classifier, SVM, Logistic Regression │
├──────────────────────────────────────────────────────────┤
│ GENERATIVE MODELS │
│ Noise z → P(x) → Synthetic Data │
│ "Tạo một ảnh mèo mới" │
│ Ví dụ: GAN, VAE, Diffusion, GPT │
└──────────────────────────────────────────────────────────┘
| 特長 | 差別的 | 生成 |
|---|---|---|
| 目標 | P(y|x) | を学習します。 P(x) または P(x|z) |
| 出力 | ラベル、スコア | 新しいデータ |
| 例 | ResNet、BERT 分類器 | GAN、安定拡散 |
| アプリケーション | 分類、検出 | 生成、合成 |
2. 生成型 AI の歴史
| 年 | マイルストーン | モデル |
|---|---|---|
| 2013年 | VAE誕生 | キングマ&ウェリング |
| 2014年 | GAN: 「ML で最もクールなアイデア」 | イアン・グッドフェロー |
| 2015年 | DCGAN: 安定した GAN トレーニング | ラドフォードら。 |
| 2018年 | StyleGAN: リアルな顔 | エヌビディア |
| 2020年 | DDPM: 普及モデル | ホーら。 |
| 2021年 | ダルイー、クリップ | オープンAI |
| 2022年 | 安定した拡散、ミッドジャーニー | 安定性AI |
| 2023年 | SDXL、DALL-E 3、ミッドジャーニー v5 | 複数 |
| 2024年 | ソラ、フラックス、SD3 | OpenAI、BFL |
| 2025-26 | ビデオ遺伝子の成熟、3D 遺伝子 | 複数 |
3. 分類 - 生成モデルの種類
3.1 GAN — 敵対的生成ネットワーク
# Concept: 2 networks chơi game
# Generator: tạo fake data
# Discriminator: phân biệt real vs fake
# Generator
z = torch.randn(batch_size, latent_dim) # random noise
fake_images = generator(z) # tạo ảnh giả
# Discriminator
real_score = discriminator(real_images) # → 1 (real)
fake_score = discriminator(fake_images) # → 0 (fake)
# Training: Generator cố gắng "lừa" Discriminator
3.2 VAE — 変分オートエンコーダー
# Concept: Encode → Latent Space → Decode
# Input image → encoder → μ, σ → sample z → decoder → reconstructed image
# Ưu điểm: latent space có cấu trúc, có thể interpolation
# Nhược điểm: ảnh thường bị blurry
3.3 普及モデル
# Concept: Thêm noise dần → Học cách bỏ noise
# Forward: image → noisy → noisier → ... → pure noise
# Reverse: pure noise → less noisy → ... → clean image
# Ưu điểm: chất lượng cao nhất hiện tại
# Nhược điểm: chậm hơn GAN (nhiều steps)
3.4 自己回帰モデル
# Concept: Tạo từng phần một, dựa vào context trước
# GPT: tạo text token by token
# PixelCNN: tạo image pixel by pixel
# DALL-E 1: text → image tokens (autoregressive)
3.5 フローベースのモデル
# Concept: Invertible transformations
# z → f1 → f2 → ... → x (exact likelihood)
# Normalizing Flows: RealNVP, Glow
# Ưu điểm: exact log-likelihood
# Nhược điểm: architecture constraints
4. Generative AI 2026 の実用化
画像の生成
- マーケティング: 広告画像、バナー、製品モックアップを作成します。
- デザイン: UI/UX プロトタイピング、コンセプト アート
- Eコマース: 商品写真撮影、バーチャル試着
ビデオの生成
- コンテンツ作成: ソーシャルメディアビデオ、広告
- 教育: 教材、シミュレーション
- エンターテイメント: SFX、アニメーション
3D と空間
- ゲーム: 3D アセットの生成
- アーキテクチャ: インテリア デザインの視覚化
- AR/VR: 仮想環境
オーディオと音楽
- ポッドキャスティング: 音声合成、編集
- 音楽: BGM、ジングル
- アクセシビリティ: テキスト読み上げ
5. ジェネレーティブ AI ランドスケープ 2026
┌──────────────────────────────────────────────────────┐
│ GENERATIVE AI STACK │
│ │
│ ┌──────────────┐ ┌──────────────┐ ┌───────────┐ │
│ │ Text-to- │ │ Text-to- │ │ Text-to- │ │
│ │ Image │ │ Video │ │ 3D │ │
│ │ │ │ │ │ │ │
│ │ • SD, SDXL │ │ • Sora │ │ • Point-E │ │
│ │ • DALL-E 3 │ │ • Runway │ │ • Magic3D │ │
│ │ • Midjourney│ │ • Kling │ │ • 3D GS │ │
│ │ • Flux │ │ • Pika │ │ │ │
│ └──────────────┘ └──────────────┘ └───────────┘ │
│ │
│ ┌──────────────────────────────────────────────┐ │
│ │ Foundation Models │ │
│ │ Diffusion Models, Transformers, GANs │ │
│ └──────────────────────────────────────────────┘ │
│ │
│ ┌──────────────────────────────────────────────┐ │
│ │ Infrastructure │ │
│ │ GPU Cloud, Model Serving, Storage │ │
│ └──────────────────────────────────────────────┘ │
└──────────────────────────────────────────────────────┘
6. 開発環境をセットアップする
# Tạo virtual environment
python -m venv genai-env
source genai-env/bin/activate
# Cài đặt core packages
pip install torch torchvision torchaudio
pip install diffusers transformers accelerate
pip install Pillow opencv-python matplotlib
# Verify GPU
python -c "import torch; print(f'CUDA: {torch.cuda.is_available()}')"
python -c "import diffusers; print(f'Diffusers: {diffusers.__version__}')"
# Quick test: generate image với Stable Diffusion
from diffusers import StableDiffusionPipeline
import torch
pipe = StableDiffusionPipeline.from_pretrained(
"stabilityai/stable-diffusion-xl-base-1.0",
torch_dtype=torch.float16,
variant="fp16"
)
pipe.to("cuda")
image = pipe("a cat wearing sunglasses, digital art").images[0]
image.save("first_genai_image.png")
print("✅ Generated first image!")
概要
| コンセプト | 説明 |
|---|---|
| 生成AI | AI が新しいコンテンツ (画像、ビデオ、オーディオ、テキスト) を作成 |
| ガン | ジェネレーターとディスクリミネーター — 高度なトレーニング |
| VAE | 潜在空間を介したエンコードとデコード — 構造化された生成 |
| 拡散 | ノイズ→ノイズ除去の段階的 — 最高品質 |
| 自己回帰 | 部分的な順次生成 — GPT、PixelCNN |
📌 次の記事: GAN の詳細 — ゼロからの敵対的生成ネットワーク、トレーニング ダイナミクス、および重要なバリアント。