マルチモーダル AI: 視覚、言語などを組み合わせる
マルチモーダル AI に関する包括的なコース — 視覚言語モデル (CLIP、LLaVA)、視覚的な質問応答、画像キャプションから、ドキュメント AI、ビデオ理解まで。 Python、PyTorch、Hugging Face Transformers、および GPT-4V、Gemini、LLaVA などの最先端のモデルを使用して練習します。
マルチモーダル AI に関する包括的なコース — 視覚言語モデル (CLIP、LLaVA)、視覚的な質問応答、画像キャプションから、ドキュメント AI、ビデオ理解まで。 Python、PyTorch、Hugging Face Transformers、および GPT-4V、Gemini、LLaVA などの最先端のモデルを使用して練習します。