多模態人工智慧:結合視覺、語言等
多模態人工智慧綜合課程-從視覺語言模型(CLIP、LLaVA)、視覺問答、影像字幕到文件人工智慧、影片理解。使用 Python、PyTorch、Hugging Face Transformers 以及 GPT-4V、Gemini、LLaVA 等最先進的模型進行練習。
多模態人工智慧綜合課程-從視覺語言模型(CLIP、LLaVA)、視覺問答、影像字幕到文件人工智慧、影片理解。使用 Python、PyTorch、Hugging Face Transformers 以及 GPT-4V、Gemini、LLaVA 等最先進的模型進行練習。