Chuyển đến nội dung chính

深層学習によるコンピューター ビジョン: CNN から Vision Transformer まで

コンピューター ビジョンに関する実践的なコース — CNN、物体検出 (YOLO)、画像セグメンテーション (SAM) からビジョン トランスフォーマー、マルチモーダル AI まで。 PyTorch、Ultralytics YOLO、Hugging Face の実践。 TensorRT と ONNX を使用して CV モデルを本番環境にデプロイします。

シリーズのご紹介

ディープラーニングを使用したコンピューター ビジョン は、基本的な画像分類から物体検出 (YOLO)、画像セグメンテーション (SAM)、ビジョン トランスフォーマーに至るまで、画像およびビデオ認識システムの構築に役立つ実践的なコースです。

🎯 コンピューター ビジョンを使用する理由 CV は、自動運転車、医療 (X 線、MRI)、小売 (顧客カウント)、セキュリティ (識別)、農業 (害虫検出)、製造 (エラー チェック) など、最も 実用的なアプリケーションを持つ AI セグメントです...

何を学ぶのですか?

パート 1: CV の基礎

  • レッスン 1: コンピューター ビジョンとは何ですか? OpenCVによる画像処理
  • レッスン 2: CNN の詳細: ResNet、EfficientNet、MobileNet
  • レッスン 3: 転移学習 — トレーニング済みモデルの使用

パート 2: オブジェクトの検出

  • レッスン 4: 🔥 YOLO v3 から v11 — すべてを検出する
  • レッスン 5: 別のデータセットに対するカスタム YOLO トレーニング
  • レッスン 6: リアルタイム検出 — カメラ、ビデオ ストリーム、追跡

パート 3: セグメンテーションと最新の履歴書

  • レッスン 7: 画像のセグメンテーション: セマンティック、インスタンス、パノプティック
  • レッスン 8: 🔥 SAM (Segment Anything) — セグメントにはトレーニングは必要ありません
  • レッスン 9: 安定した拡散と画像生成
  • レッスン 10: ビジョントランスフォーマー (ViT) と CLIP

パート 4: アプリケーションと展開

  • レッスン 11: ベトナム人のための OCR と文書の理解
  • レッスン 12: マルチモーダル AI: GPT-4o ビジョン、ジェミニ ビジョン
  • レッスン 13: エッジ デプロイメント: TensorRT、ONNX、モバイル
  • レッスン 14: Capstone: エンドツーエンド CV システム

入力が必要です

  • 中級 Python (NumPy、matplotlib)
  • ニューラル ネットワークの基本的な理解 (または「AI & LLM」シリーズのレッスン 1 ~ 4 を完了)
  • Google Colab (無料、T4 GPU を提供)
  • ローカル GPU は有利ですが、必須ではありません

使用したツール

Python 3.11+       | Ngôn ngữ chính
PyTorch            | Deep Learning framework
Ultralytics        | YOLOv8/v11
OpenCV             | Image processing
Hugging Face       | ViT, SAM, SegFormer
Roboflow           | Data labeling & management
Google Colab       | Free GPU training
TensorRT / ONNX    | Model optimization
Streamlit          | Demo web app