Chuyển đến nội dung chính

レッスン 1: 生成 AI とは何ですか? — クリエイティブな AI ランドスケープ

生成 AI の定義、判別モデルと生成モデルの区別。ボルツマンマシンから普及モデルまでの開発の歴史。生成モデルの種類: GAN、VAE、フローベース、拡散、自己回帰。現実的なアプリケーションと 2026 年の現在の状況。

🧠 AI と ML — レッスン 0 レッスン 1: 生成 AI とは何ですか? — AI パノラマ 創造性

生成 AI: AI を使用して画像とビデオを作成する

パート 1: 生成 AI プラットフォーム — 理論とアーキテクチャ

xdev.asia

はじめに

生成 AI は、単なる分類や予測ではなく、新しいコンテンツ (画像、ビデオ、サウンド、テキスト、コード) を生成する機能を備えた AI の分野です。これは「認知型」AI から「創造型」AI への飛躍です。

💡 差別モデルは「これは何ですか?」と答えます。 — 生成モデル は、「新しいモデルを作成するにはどうすればよいですか?」に答えます。


1. 識別モデルと生成モデル

┌──────────────────────────────────────────────────────────┐
│              DISCRIMINATIVE MODELS                        │
│   Input: x → P(y|x) → Label/Class                       │
│   "Ảnh này là mèo hay chó?"                             │
│   Ví dụ: CNN classifier, SVM, Logistic Regression       │
├──────────────────────────────────────────────────────────┤
│              GENERATIVE MODELS                            │
│   Noise z → P(x) → Synthetic Data                       │
│   "Tạo một ảnh mèo mới"                                │
│   Ví dụ: GAN, VAE, Diffusion, GPT                       │
└──────────────────────────────────────────────────────────┘
特長差別的生成
目標P(y|x)を学習します。 P(x) または P(x|z)
出力ラベル、スコア新しいデータ
例ResNet、BERT 分類器GAN、安定拡散
アプリケーション分類、検出生成、合成

2. 生成型 AI の歴史

年マイルストーンモデル
2013年VAE誕生キングマ&ウェリング
2014年GAN: 「ML で最もクールなアイデア」イアン・グッドフェロー
2015年DCGAN: 安定した GAN トレーニングラドフォードら。
2018年StyleGAN: リアルな顔エヌビディア
2020年DDPM: 普及モデルホーら。
2021年ダルイー、クリップオープンAI
2022年安定した拡散、ミッドジャーニー安定性AI
2023年SDXL、DALL-E 3、ミッドジャーニー v5複数
2024年ソラ、フラックス、SD3OpenAI、BFL
2025-26ビデオ遺伝子の成熟、3D 遺伝子複数

3. 分類 - 生成モデルの種類

3.1 GAN — 敵対的生成ネットワーク

# Concept: 2 networks chơi game
# Generator: tạo fake data
# Discriminator: phân biệt real vs fake

# Generator
z = torch.randn(batch_size, latent_dim)  # random noise
fake_images = generator(z)  # tạo ảnh giả

# Discriminator
real_score = discriminator(real_images)  # → 1 (real)
fake_score = discriminator(fake_images)  # → 0 (fake)

# Training: Generator cố gắng "lừa" Discriminator

3.2 VAE — 変分オートエンコーダー

# Concept: Encode → Latent Space → Decode
# Input image → encoder → μ, σ → sample z → decoder → reconstructed image

# Ưu điểm: latent space có cấu trúc, có thể interpolation
# Nhược điểm: ảnh thường bị blurry

3.3 普及モデル

# Concept: Thêm noise dần → Học cách bỏ noise
# Forward: image → noisy → noisier → ... → pure noise
# Reverse: pure noise → less noisy → ... → clean image

# Ưu điểm: chất lượng cao nhất hiện tại
# Nhược điểm: chậm hơn GAN (nhiều steps)

3.4 自己回帰モデル

# Concept: Tạo từng phần một, dựa vào context trước
# GPT: tạo text token by token
# PixelCNN: tạo image pixel by pixel
# DALL-E 1: text → image tokens (autoregressive)

3.5 フローベースのモデル

# Concept: Invertible transformations
# z → f1 → f2 → ... → x (exact likelihood)
# Normalizing Flows: RealNVP, Glow
# Ưu điểm: exact log-likelihood
# Nhược điểm: architecture constraints

4. Generative AI 2026 の実用化

画像の生成

  • マーケティング: 広告画像、バナー、製品モックアップを作成します。
  • デザイン: UI/UX プロトタイピング、コンセプト アート
  • Eコマース: 商品写真撮影、バーチャル試着

ビデオの生成

  • コンテンツ作成: ソーシャルメディアビデオ、広告
  • 教育: 教材、シミュレーション
  • エンターテイメント: SFX、アニメーション

3D と空間

  • ゲーム: 3D アセットの生成
  • アーキテクチャ: インテリア デザインの視覚化
  • AR/VR: 仮想環境

オーディオと音楽

  • ポッドキャスティング: 音声合成、編集
  • 音楽: BGM、ジングル
  • アクセシビリティ: テキスト読み上げ

5. ジェネレーティブ AI ランドスケープ 2026

┌──────────────────────────────────────────────────────┐
│                GENERATIVE AI STACK                    │
│                                                      │
│  ┌──────────────┐  ┌──────────────┐  ┌───────────┐  │
│  │   Text-to-   │  │  Text-to-    │  │ Text-to-  │  │
│  │    Image      │  │   Video      │  │   3D      │  │
│  │              │  │              │  │           │  │
│  │ • SD, SDXL  │  │ • Sora       │  │ • Point-E │  │
│  │ • DALL-E 3  │  │ • Runway     │  │ • Magic3D │  │
│  │ • Midjourney│  │ • Kling      │  │ • 3D GS   │  │
│  │ • Flux      │  │ • Pika       │  │           │  │
│  └──────────────┘  └──────────────┘  └───────────┘  │
│                                                      │
│  ┌──────────────────────────────────────────────┐    │
│  │            Foundation Models                  │    │
│  │  Diffusion Models, Transformers, GANs        │    │
│  └──────────────────────────────────────────────┘    │
│                                                      │
│  ┌──────────────────────────────────────────────┐    │
│  │            Infrastructure                     │    │
│  │  GPU Cloud, Model Serving, Storage           │    │
│  └──────────────────────────────────────────────┘    │
└──────────────────────────────────────────────────────┘

6. 開発環境をセットアップする

# Tạo virtual environment
python -m venv genai-env
source genai-env/bin/activate

# Cài đặt core packages
pip install torch torchvision torchaudio
pip install diffusers transformers accelerate
pip install Pillow opencv-python matplotlib

# Verify GPU
python -c "import torch; print(f'CUDA: {torch.cuda.is_available()}')"
python -c "import diffusers; print(f'Diffusers: {diffusers.__version__}')"
# Quick test: generate image với Stable Diffusion
from diffusers import StableDiffusionPipeline
import torch

pipe = StableDiffusionPipeline.from_pretrained(
    "stabilityai/stable-diffusion-xl-base-1.0",
    torch_dtype=torch.float16,
    variant="fp16"
)
pipe.to("cuda")

image = pipe("a cat wearing sunglasses, digital art").images[0]
image.save("first_genai_image.png")
print("✅ Generated first image!")

概要

コンセプト説明
生成AIAI が新しいコンテンツ (画像、ビデオ、オーディオ、テキスト) を作成
ガンジェネレーターとディスクリミネーター — 高度なトレーニング
VAE潜在空間を介したエンコードとデコード — 構造化された生成
拡散ノイズ→ノイズ除去の段階的 — 最高品質
自己回帰部分的な順次生成 — GPT、PixelCNN

📌 次の記事: GAN の詳細 — ゼロからの敵対的生成ネットワーク、トレーニング ダイナミクス、および重要なバリアント。