视觉语言模型


文档摘要

视觉语言模型 视觉语言模型(vision-language model,VLM)能够联合理解图像与文本,从而支持视觉问答、图像描述生成以及视觉推理。本文件涵盖 VQA、图像描述生成、视觉定位,以及 VisualBERT、BLIP、LLaVA、Flamingo、PaLI、Qwen-VL 等将视觉编码器与大型语言模型融合的架构。 想象一位博物馆讲解员,能看着一幅画就娓娓道来它的一切:画里有哪些物体、讲了一个什么故事、传达了怎样的情绪,还能回答游客提出的任何问题。视觉语言模型(vision-language model,VLM)就是它的计算等价物——一个联合理解图像和文本的系统,能够描述视觉场景、回答关于场景的问题、遵循视觉指令,甚至根据自然语言查询在图像中定位特定的物体。


发布者: 作者: HenryNdubuaku 转发
评论区 (0)
U