Chuyển đến nội dung chính

Bài 1: Tổng quan AI, ML, DL và LLM

Bức tranh toàn cảnh về AI, Machine Learning, Deep Learning và Large Language Models. Từ lịch sử 1950 đến ChatGPT moment 2022, tại sao LLM bùng nổ, và lộ trình học tập của toàn series.

🧠 AI & ML — Bài 0 Bài 1: Tổng quan AI, ML, DL và LLM

AI & LLM: Từ Cơ bản đến Nâng cao

Phần 1: Nền tảng AI & Deep Learning

xdev.asia

Giới thiệu

Trước khi bắt tay vào viết code hay tinh chỉnh mô hình, bạn cần có một bức tranh toàn cảnh về lĩnh vực này. Bài học đầu tiên sẽ giúp bạn hiểu AI là gì, các khái niệm liên quan khác nhau như thế nào, và tại sao năm 2022–2025 lại là giai đoạn bùng nổ chưa từng có của LLM.


1. AI là gì? Lịch sử ngắn gọn (1950 → nay)

Trí tuệ nhân tạo (Artificial Intelligence — AI) là ngành khoa học máy tính nghiên cứu cách tạo ra các hệ thống có khả năng thực hiện những nhiệm vụ thường đòi hỏi trí tuệ của con người: nhận diện hình ảnh, hiểu ngôn ngữ, chơi cờ, lái xe, v.v.

Dòng thời gian chính

NămSự kiện
1950Alan Turing đề xuất "Turing Test" — bài kiểm tra xem máy có thể mô phỏng con người không
1956Hội nghị Dartmouth — thuật ngữ "Artificial Intelligence" ra đời chính thức
1960s–70s"AI Winter" đầu tiên: kỳ vọng vượt xa thực tế, tài trợ cạn kiệt
1980sExpert Systems bùng nổ rồi suy tàn; "AI Winter" thứ hai
1997Deep Blue (IBM) đánh bại Garry Kasparov — cột mốc lịch sử AI
2006Geoffrey Hinton hồi sinh Deep Learning với "Deep Belief Networks"
2012AlexNet giành ImageNet với khoảng cách lớn — Deep Learning trở thành chủ đạo
2017Google Brain công bố bài báo "Attention Is All You Need" → kiến trúc Transformer
2018Google BERT; OpenAI GPT-1
2020GPT-3 (175 tỷ tham số) gây chấn động cộng đồng
2022ChatGPT ra mắt — AI đến tay 100 triệu người dùng trong 2 tháng
2023–2025Cuộc đua LLM: GPT-4, Claude 3, Gemini, LLaMA 3, Mistral...

2. Phân biệt AI / Machine Learning / Deep Learning / LLM

Nhiều người dùng các thuật ngữ này thay thế nhau, nhưng chúng có quan hệ lồng nhau (nested), không phải đồng nghĩa.

Sơ đồ quan hệ lồng nhau giữa AI, Machine Learning, Deep Learning và LLM

┌─────────────────────────────────────────────────────┐
│  Trí tuệ nhân tạo (AI)                              │
│                                                     │
│   ┌─────────────────────────────────────────────┐   │
│   │  Machine Learning (ML)                      │   │
│   │                                             │   │
│   │   ┌─────────────────────────────────────┐   │   │
│   │   │  Deep Learning (DL)                 │   │   │
│   │   │                                     │   │   │
│   │   │   ┌─────────────────────────────┐   │   │   │
│   │   │   │  Large Language Models      │   │   │   │
│   │   │   │  (LLM)                      │   │   │   │
│   │   │   └─────────────────────────────┘   │   │   │
│   │   └─────────────────────────────────────┘   │   │
│   └─────────────────────────────────────────────┘   │
└─────────────────────────────────────────────────────┘

So sánh chi tiết

Khái niệmĐịnh nghĩaVí dụCần dữ liệu
AIHệ thống mô phỏng trí tuệ ngườiChess engine, chatbot, xe tự láiTùy loại
MLAI học từ dữ liệu thay vì lập trình cứngSpam filter, gợi ý NetflixHàng nghìn - triệu mẫu
DLML dùng mạng nơ-ron nhiều lớpNhận diện khuôn mặt, dịch thuậtHàng triệu - tỷ mẫu
LLMDL quy mô cực lớn, huấn luyện trên văn bảnChatGPT, Claude, GeminiHàng nghìn tỷ token

Điểm mấu chốt: Không phải mọi AI đều là ML, không phải mọi ML đều là DL, và LLM là một dạng đặc biệt của DL.


3. Tại sao LLM bùng nổ 2022–2025?

3.1 The ChatGPT Moment

Ngày 30/11/2022, OpenAI ra mắt ChatGPT. Chỉ trong 5 ngày đầu, nó đạt 1 triệu người dùng — nhanh hơn bất kỳ sản phẩm công nghệ nào trong lịch sử. Đến tháng 1/2023 đã có 100 triệu người dùng. Đây là lần đầu tiên AI trở thành công cụ phổ thông cho đại chúng, không chỉ dành cho nhà nghiên cứu.

3.2 Scaling Laws — Quy luật tỷ lệ

Năm 2020, OpenAI công bố bài báo quan trọng về Scaling Laws: nếu bạn tăng đồng thời số tham số mô hình, lượng dữ liệu, và sức mạnh tính toán theo tỷ lệ nhất định, hiệu năng sẽ cải thiện một cách có thể dự đoán được.

Hiệu năng ∝ (Tham số)^α × (Dữ liệu)^β × (Compute)^γ

Điều này có nghĩa: không cần đột phá thuật toán — chỉ cần tiền và GPU, bạn có thể tạo mô hình tốt hơn. Đây là lý do các công ty lớn đổ hàng tỷ đô vào cuộc đua AI.

3.3 Ba yếu tố hội tụ

  1. Dữ liệu: Internet tạo ra hàng nghìn tỷ từ văn bản (Common Crawl, Wikipedia, GitHub, sách...)
  2. Tính toán: GPU/TPU ngày càng mạnh hơn (NVIDIA A100, H100); cloud computing phổ biến
  3. Kiến trúc: Transformer (2017) thay thế RNN — song song hóa tốt hơn, scale tốt hơn

3.4 RLHF — Bí quyết của ChatGPT

ChatGPT không chỉ là GPT-3 to hơn. Bí quyết là RLHF (Reinforcement Learning from Human Feedback): huấn luyện mô hình để phản hồi phù hợp với mong đợi và giá trị con người, thay vì chỉ tối ưu hóa "đoán từ tiếp theo". Đây là bước nhảy vọt từ "mô hình ngôn ngữ" sang "trợ lý AI".


4. Các LLM nổi bật: Bảng so sánh

ModelTổ chứcParams (ước tính)Open SourceĐiểm mạnh
GPT-4oOpenAI~200B (ẩn)KhôngĐa năng, multimodal, tool use
Claude 3.5 SonnetAnthropic~100B (ẩn)KhôngLập luận dài, an toàn, coding
Gemini 1.5 ProGoogle~500B (ẩn)KhôngContext window 1M tokens
LLaMA 3.1 405BMeta405BCóMạnh nhất open-source, có thể self-host
Mistral LargeMistral AI~100B (ẩn)Một phầnHiệu quả, multilingual
Qwen2.5 72BAlibaba72BCóCode, toán học, tiếng Trung/Việt tốt
Phi-3.5Microsoft3.8BCóNhỏ gọn, chạy được trên laptop

Lưu ý cho người học: Năm 2024–2025, ranh giới giữa open và closed-source ngày càng mờ. "Open weights" (mở trọng số) khác với "open source" (mở code huấn luyện). LLaMA là open weights, không phải open source theo nghĩa truyền thống.


5. Lộ trình của series này

Lộ trình học tập từ Nền tảng đến Ứng dụng thực tế

Series này được chia thành 5 phần chính:

Phần 1: Nền tảng AI & Deep Learning (Bài 1–5)
   ├── Bài 1: Tổng quan (bài này)
   ├── Bài 2: Toán học cho AI
   ├── Bài 3: Neural Networks cơ bản
   ├── Bài 4: Deep Learning Overview (CNN, RNN, LSTM)
   └── Bài 5: Attention Mechanism

Phần 2: Kiến trúc Transformer (Bài 6–9)
   ├── Bài 6: The Transformer Architecture
   ├── Bài 7: BERT & Encoder Models
   ├── Bài 8: GPT & Decoder Models
   └── Bài 9: Modern LLM Architectures

Phần 3: Làm việc với LLM (Bài 10–14)
   ├── Bài 10: Prompting & Prompt Engineering
   ├── Bài 11: OpenAI / Anthropic API
   ├── Bài 12: LangChain & LlamaIndex
   ├── Bài 13: RAG — Retrieval Augmented Generation
   └── Bài 14: Vector Databases

Phần 4: Fine-tuning & Deployment (Bài 15–19)
   ├── Bài 15: Fine-tuning cơ bản
   ├── Bài 16: LoRA & QLoRA
   ├── Bài 17: Quantization & Optimization
   ├── Bài 18: Deployment với vLLM & Ollama
   └── Bài 19: Production MLOps cho LLM

Phần 5: Ứng dụng thực tế (Bài 20–24)
   ├── Bài 20: AI Agents & Tool Use
   ├── Bài 21: Multimodal AI
   ├── Bài 22: Code Generation & AI-assisted Dev
   ├── Bài 23: AI trong doanh nghiệp Việt Nam
   └── Bài 24: Xu hướng & Tương lai

Prerequisite: Python cơ bản (biết viết function, loop, class). Các bài toán học và lý thuyết sẽ được giải thích từ đầu.


6. Môi trường cài đặt

6.1 Cài đặt Python

Khuyến nghị dùng Python 3.11 (ổn định, hỗ trợ tốt nhất với hầu hết thư viện AI tính đến 2025).

# Kiểm tra Python đã có chưa
python --version
# hoặc
python3 --version

6.2 Conda — Quản lý môi trường ảo

Conda là công cụ quản lý môi trường tốt nhất cho AI/ML vì xử lý được cả thư viện Python lẫn C/CUDA.

# Tải Miniconda (nhỏ gọn hơn Anaconda)
# Truy cập: https://docs.conda.io/en/latest/miniconda.html

# Tạo môi trường cho series này
conda create -n ai-llm python=3.11 -y
conda activate ai-llm

# Cài các thư viện cơ bản
conda install numpy pandas matplotlib jupyter -y
pip install torch torchvision --index-url https://download.pytorch.org/whl/cu121
pip install transformers datasets accelerate
pip install openai anthropic langchain

6.3 Cấu trúc thư mục khuyến nghị

ai-llm-series/
├── notebooks/          # Jupyter notebooks cho từng bài
│   ├── 01_overview/
│   ├── 02_math/
│   └── ...
├── src/                # Code Python tái sử dụng
│   ├── models/
│   └── utils/
├── data/               # Dataset nhỏ để thực hành
└── requirements.txt

6.4 Jupyter Lab

pip install jupyterlab
jupyter lab   # Mở trình duyệt tại http://localhost:8888

6.5 Kiểm tra môi trường

# Chạy cell này trong Jupyter để kiểm tra
import sys
import numpy as np
import torch

print(f"Python: {sys.version}")
print(f"NumPy: {np.__version__}")
print(f"PyTorch: {torch.__version__}")
print(f"CUDA available: {torch.cuda.is_available()}")

if torch.cuda.is_available():
    print(f"GPU: {torch.cuda.get_device_name(0)}")
    print(f"VRAM: {torch.cuda.get_device_properties(0).total_memory / 1e9:.1f} GB")
else:
    print("Đang chạy trên CPU — vẫn ổn cho các bài đầu!")

6.6 Nếu không có GPU

Không cần lo lắng! Các bài đầu (Bài 1–7) chạy tốt trên CPU. Bắt đầu cần GPU từ Bài 8 trở đi. Bạn có thể dùng:

  • Google Colab (miễn phí, T4 GPU): colab.research.google.com
  • Kaggle Notebooks (miễn phí, 30h/tuần GPU): kaggle.com/code
  • Vast.ai / RunPod: thuê GPU giá rẻ (~$0.3–0.5/giờ cho RTX 3090)

Tóm tắt bài học

  • AI là lĩnh vực rộng; ML là AI học từ dữ liệu; DL là ML dùng neural network sâu; LLM là DL quy mô lớn trên văn bản
  • LLM bùng nổ nhờ ba yếu tố hội tụ: dữ liệu khổng lồ + GPU mạnh + kiến trúc Transformer
  • ChatGPT (11/2022) là "iPhone moment" của AI — đưa công nghệ đến tay đại chúng
  • Series này sẽ đi từ nền tảng toán học đến xây dựng ứng dụng LLM thực tế
  • Cài đặt Python 3.11 + Conda + PyTorch ngay bây giờ để sẵn sàng cho bài tiếp theo

Bài tập

  1. Cài đặt môi trường Conda và chạy thành công đoạn code kiểm tra ở phần 6.5
  2. Tạo tài khoản trên Google Colab và chạy thử một notebook
  3. Đọc abstract của bài báo gốc "Attention Is All You Need" (2017) tại arxiv.org/abs/1706.03762
  4. Liệt kê 3 ứng dụng AI mà bạn đang dùng hàng ngày và xác định chúng thuộc loại AI nào (ML, DL, LLM, hay rule-based AI)