Giới thiệu Series
Computer Vision với Deep Learning là khóa học thực chiến giúp bạn xây dựng hệ thống nhận dạng hình ảnh và video — từ phân loại ảnh cơ bản đến object detection (YOLO), image segmentation (SAM), và Vision Transformer.
🎯 Tại sao Computer Vision? CV là mảng AI có ứng dụng thực tế nhiều nhất: xe tự lái, y tế (X-ray, MRI), bán lẻ (đếm khách), an ninh (nhận dạng), nông nghiệp (phát hiện sâu bệnh), sản xuất (kiểm tra lỗi)...
Bạn sẽ học được gì?
Phần 1: Nền tảng CV
- Bài 1: Computer Vision là gì? Image processing với OpenCV
- Bài 2: CNN Deep Dive: ResNet, EfficientNet, MobileNet
- Bài 3: Transfer Learning — dùng model đã huấn luyện
Phần 2: Object Detection
- Bài 4: 🔥 YOLO từ v3 đến v11 — detect mọi thứ
- Bài 5: Huấn luyện YOLO custom cho dataset riêng
- Bài 6: Real-time detection — camera, video stream, tracking
Phần 3: Segmentation & Modern CV
- Bài 7: Image Segmentation: semantic, instance, panoptic
- Bài 8: 🔥 SAM (Segment Anything) — segment không cần train
- Bài 9: Stable Diffusion & Image Generation
- Bài 10: Vision Transformer (ViT) & CLIP
Phần 4: Ứng dụng & Deployment
- Bài 11: OCR & Document Understanding cho tiếng Việt
- Bài 12: Multimodal AI: GPT-4o Vision, Gemini Vision
- Bài 13: Edge Deployment: TensorRT, ONNX, Mobile
- Bài 14: Capstone: hệ thống CV end-to-end
Yêu cầu đầu vào
- Python trung cấp (NumPy, matplotlib)
- Hiểu cơ bản về Neural Networks (hoặc hoàn thành series "AI & LLM" bài 1-4)
- Google Colab (miễn phí, cung cấp GPU T4)
- GPU local là lợi thế nhưng không bắt buộc
Công cụ sử dụng
Python 3.11+ | Ngôn ngữ chính
PyTorch | Deep Learning framework
Ultralytics | YOLOv8/v11
OpenCV | Image processing
Hugging Face | ViT, SAM, SegFormer
Roboflow | Data labeling & management
Google Colab | Free GPU training
TensorRT / ONNX | Model optimization
Streamlit | Demo web app
