系列介紹
電腦視覺與深度學習是一門實作課程,可協助您建立影像和視訊辨識系統 - 從基本影像分類到物件偵測 (YOLO)、影像分割 (SAM) 和 Vision Transformer。
🎯 為什麼選擇電腦視覺? ** CV 是具有最**實際應用的人工智慧領域:自動駕駛汽車、醫療(X 射線、MRI)、零售(客戶計數)、安全(識別)、農業(害蟲檢測)、製造(錯誤檢查)...
你會學到什麼?
第 1 部分:履歷基礎
- 第 1 課: 什麼是電腦視覺?使用 OpenCV 進行影像處理
- 第 2 課: CNN 深入研究:ResNet、EfficientNet、MobileNet
- 第 3 課: 遷移學習 — 使用經過訓練的模型
第 2 部分:物體偵測
- 第 4 課: 🔥 YOLO 從 v3 到 v11 — 偵測所有內容
- 第 5 課: 針對單獨資料集的自訂 YOLO 訓練
- 第 6 課: 即時偵測 — 攝影機、視訊串流、追蹤
第 3 部分:細分與現代履歷
- 第 7 課: 影像分割:語意、實例、全景
- 第 8 課: 🔥 SAM (Segment Anything) — 分段不需要訓練
- 第 9 課: 穩定擴散與影像生成
- 第 10 課: 視覺轉換器 (ViT) 和 CLIP
第 4 部分:應用程式和部署
- 第 11 課: OCR 和越南語文件理解
- 第 12 課: 多模態 AI:GPT-4o 視覺、Gemini 視覺
- 第 13 課: 邊緣部署:TensorRT、ONNX、移動
- 第 14 課: 頂點:端對端 CV 系統
需要輸入
- 中階 Python(NumPy、matplotlib)
- 對神經網路的基本了解(或完成「AI & LLM」系列課程 1-4)
- Google Colab(免費,提供 T4 GPU)
- 本地 GPU 很有優勢,但不是必需的
使用的工具
Python 3.11+ | Ngôn ngữ chính
PyTorch | Deep Learning framework
Ultralytics | YOLOv8/v11
OpenCV | Image processing
Hugging Face | ViT, SAM, SegFormer
Roboflow | Data labeling & management
Google Colab | Free GPU training
TensorRT / ONNX | Model optimization
Streamlit | Demo web app