Chuyển đến nội dung chính

深度學習的電腦視覺:從 CNN 到 Vision Transformer

電腦視覺實用課程 — 從 CNN、目標偵測 (YOLO)、影像分割 (SAM) 到視覺轉換器和多模態 AI。親身實踐 PyTorch、Ultralytics YOLO、Hugging Face。使用 TensorRT 和 ONNX 將 CV 模型部署到生產環境。

系列介紹

電腦視覺與深度學習是一門實作課程,可協助您建立影像和視訊辨識系統 - 從基本影像分類到物件偵測 (YOLO)、影像分割 (SAM) 和 Vision Transformer。

🎯 為什麼選擇電腦視覺? ** CV 是具有最**實際應用的人工智慧領域:自動駕駛汽車、醫療(X 射線、MRI)、零售(客戶計數)、安全(識別)、農業(害蟲檢測)、製造(錯誤檢查)...

你會學到什麼?

第 1 部分:履歷基礎

  • 第 1 課: 什麼是電腦視覺?使用 OpenCV 進行影像處理
  • 第 2 課: CNN 深入研究:ResNet、EfficientNet、MobileNet
  • 第 3 課: 遷移學習 — 使用經過訓練的模型

第 2 部分:物體偵測

  • 第 4 課: 🔥 YOLO 從 v3 到 v11 — 偵測所有內容
  • 第 5 課: 針對單獨資料集的自訂 YOLO 訓練
  • 第 6 課: 即時偵測 — 攝影機、視訊串流、追蹤

第 3 部分:細分與現代履歷

  • 第 7 課: 影像分割:語意、實例、全景
  • 第 8 課: 🔥 SAM (Segment Anything) — 分段不需要訓練
  • 第 9 課: 穩定擴散與影像生成
  • 第 10 課: 視覺轉換器 (ViT) 和 CLIP

第 4 部分:應用程式和部署

  • 第 11 課: OCR 和越南語文件理解
  • 第 12 課: 多模態 AI:GPT-4o 視覺、Gemini 視覺
  • 第 13 課: 邊緣部署:TensorRT、ONNX、移動
  • 第 14 課: 頂點:端對端 CV 系統

需要輸入

  • 中階 Python(NumPy、matplotlib)
  • 對神經網路的基本了解(或完成「AI & LLM」系列課程 1-4)
  • Google Colab(免費,提供 T4 GPU)
  • 本地 GPU 很有優勢,但不是必需的

使用的工具

Python 3.11+       | Ngôn ngữ chính
PyTorch            | Deep Learning framework
Ultralytics        | YOLOv8/v11
OpenCV             | Image processing
Hugging Face       | ViT, SAM, SegFormer
Roboflow           | Data labeling & management
Google Colab       | Free GPU training
TensorRT / ONNX    | Model optimization
Streamlit          | Demo web app