Chuyển đến nội dung chính
Trung cấp

Computer Vision với Deep Learning: Từ CNN đến Vision Transformer

Khóa học thực chiến về Computer Vision — từ CNN, Object Detection (YOLO), Image Segmentation (SAM) đến Vision Transformer và Multimodal AI. Hands-on với PyTorch, Ultralytics YOLO, Hugging Face. Deploy mô hình CV lên production với TensorRT và ONNX.

DUY TRANDuy Tran
14 bài học
50 giờ
Computer Vision với Deep Learning: Từ CNN đến Vision Transformer

Nội dung series

5 phần · 14 bài học

Giới thiệu Series

Computer Vision với Deep Learning là khóa học thực chiến giúp bạn xây dựng hệ thống nhận dạng hình ảnh và video — từ phân loại ảnh cơ bản đến object detection (YOLO), image segmentation (SAM), và Vision Transformer.

🎯 Tại sao Computer Vision? CV là mảng AI có ứng dụng thực tế nhiều nhất: xe tự lái, y tế (X-ray, MRI), bán lẻ (đếm khách), an ninh (nhận dạng), nông nghiệp (phát hiện sâu bệnh), sản xuất (kiểm tra lỗi)...

Bạn sẽ học được gì?

Phần 1: Nền tảng CV

  • Bài 1: Computer Vision là gì? Image processing với OpenCV
  • Bài 2: CNN Deep Dive: ResNet, EfficientNet, MobileNet
  • Bài 3: Transfer Learning — dùng model đã huấn luyện

Phần 2: Object Detection

  • Bài 4: 🔥 YOLO từ v3 đến v11 — detect mọi thứ
  • Bài 5: Huấn luyện YOLO custom cho dataset riêng
  • Bài 6: Real-time detection — camera, video stream, tracking

Phần 3: Segmentation & Modern CV

  • Bài 7: Image Segmentation: semantic, instance, panoptic
  • Bài 8: 🔥 SAM (Segment Anything) — segment không cần train
  • Bài 9: Stable Diffusion & Image Generation
  • Bài 10: Vision Transformer (ViT) & CLIP

Phần 4: Ứng dụng & Deployment

  • Bài 11: OCR & Document Understanding cho tiếng Việt
  • Bài 12: Multimodal AI: GPT-4o Vision, Gemini Vision
  • Bài 13: Edge Deployment: TensorRT, ONNX, Mobile
  • Bài 14: Capstone: hệ thống CV end-to-end

Yêu cầu đầu vào

  • Python trung cấp (NumPy, matplotlib)
  • Hiểu cơ bản về Neural Networks (hoặc hoàn thành series "AI & LLM" bài 1-4)
  • Google Colab (miễn phí, cung cấp GPU T4)
  • GPU local là lợi thế nhưng không bắt buộc

Công cụ sử dụng

Python 3.11+       | Ngôn ngữ chính
PyTorch            | Deep Learning framework
Ultralytics        | YOLOv8/v11
OpenCV             | Image processing
Hugging Face       | ViT, SAM, SegFormer
Roboflow           | Data labeling & management
Google Colab       | Free GPU training
TensorRT / ONNX    | Model optimization
Streamlit          | Demo web app
DUY TRAN
Tác giả

DUY TRAN

Pursuing an AI-first mindset and intelligent system architecture. I build solutions by combining technology, creativity, and the ability to see structure in chaos — the foundation for becoming a Solution Architect.

Bình luận