4.1 多模态大模型演进 本节摘要:让机器看懂图、理解视频,是自然语言理解向多模态延伸的核心。本节梳理从 CLIP 到 BLIP 再到 LLaVA 的三代多模态大模型演进——CLIP 用对比学习把图文对齐到同一空间,BLIP 引入融合理解能力,LLaVA 把视觉编码器直接接进大语言模型实现多模态对话。理解这条演进线,就能看清当前图文任务该用哪种技术,以及每种技术的天花板在哪。 先说结论 阅读完本节,你应当能够: 说清 CLIP 用对比学习对齐图文空间的原理,以及它为什么引爆了多模态领域 解释 BLIP 相对 CLIP 多了什么能力(融合理解、生成) 描述 LLaVA 如何把视觉能力接入大语言模型,开启多模态对话 判断一类图文任务该用哪一代技术 一、问题与直觉
本节摘要:让机器看懂图、理解视频,是自然语言理解向多模态延伸的核心。本节梳理从 CLIP 到 BLIP 再到 LLaVA 的三代多模态大模型演进——CLIP 用对比学习把图文对齐到同一空间,BLIP 引入融合理解能力,LLaVA 把视觉编码器直接接进大语言模型实现多模态对话。理解这条演进线,就能看清当前图文任务该用哪种技术,以及每种技术的天花板在哪。
阅读完本节,你应当能够:
让计算机"看图说话"这件事,听上去简单,难了二三十年。早期的做法是先把图像识别成一组标签("猫""沙发""室内"),再把标签拼成句子——结果是机械、生硬、丢失关系的描述("一只猫,一个沙发")。问题在于图像和语言是两个完全不同的信号,硬要把图像先翻译成离散标签再接语言,中间损失太大。
真正的突破来自一个关键洞察:与其在图像和语言之间架一座"翻译桥",不如让它们直接学习同一个语义空间。一张猫的图片和"一只猫"这句话,如果能在同一个向量空间里被映射到相近的位置,那图像和语言就天然"对齐"了——这是 CLIP 的核心思想,也是现代多模态的起点。
从 CLIP 往后,多模态大模型沿着"对齐 → 融合 → 生成"三步走:先对齐(CLIP 让图文能比较),再融合(BLIP 让模型能深度理解图文关系),再生成(LLaVA 让模型能基于图像自由对话)。这一节我们就顺着这条线讲。
CLIP(Contrastive Language-Image Pre-training)2021 年问世,是现代多模态的奠基之作。它的核心做法是对比学习:用海量"图像-文本"配对(比如一张猫的图配"一只橘猫坐在窗台上"这句话),训练两个编码器——图像编码器和文本编码器——让配对的图文在向量空间里靠近,不配对的远离。
训练完,CLIP 得到两个对齐的编码器。给它一张图和一句话,它能算出两者有多匹配;给它一张图,它能在候选句子里找出最贴切的描述;给它一句话,它能在图片库里找出最匹配的图。这就是跨模态检索的能力——图搜文、文搜图都通了。
CLIP 的革命性在于它证明了:只要有足够多的图文配对(CLIP 用了 4 亿对),不需要人工标注,模型就能自动学会图文的对齐关系。这绕开了传统方法依赖人工标签的瓶颈,让多模态第一次具备了大规模落地的可能。
但 CLIP 也有明显局限。它本质是个"匹配"模型——判断图文配不配,但不理解图里的细节关系。问它"图里的猫在沙发左边还是右边""猫的眼睛是什么颜色",CLIP 答不好,因为对比学习只学了整体匹配,没学细粒度的图文关系。
BLIP(Bootstrapping Language-Image Pre-training)针对 CLIP 的局限,引入了图文融合能力。它不再只是把图和文分别编码再算相似度(双塔),而是让图像特征和文本特征在一个模型里深度交互(交叉注意力),从而理解"图里的哪个区域对应文里的哪个词"这种细粒度关系。
下面这张图把 CLIP、BLIP、LLaVA 三代的架构差异和能做的事画在一起,演进逻辑一目了然。

BLIP 还有一个重要贡献是能生成图像描述(captioning)——给一张图,它能输出一段描述性的文字。这超出了 CLIP 只能"判断匹配"的范围,进入了"理解后表达"的阶段。BLIP 的视觉问答(VQA)能力也更强——给一张图问问题,它能基于对图的理解作答。
LLaVA(Large Language and Vision Assistant)代表了当前的主流方向:把视觉能力直接接入大语言模型。它的做法很巧妙——用一个预训练好的视觉编码器(通常是 CLIP 的 ViT)提取图像特征,通过一个投影层把图像特征对齐到语言模型的词向量空间,然后像处理文本 token 一样,把图像 token 和文本 token 一起喂给大语言模型。
这样做的好处是,语言模型原本的全部能力(推理、对话、遵循指令)都直接复用到了多模态上。模型既能看图,又能用语言模型的能力对图进行推理和对话——这是 CLIP 和 BLIP 这种专用架构做不到的。LLaVA 开启了"多模态对话"的时代:你发张图问"这道菜大概多少卡路里""这张图表说明什么趋势",它能像聊天一样回答。
LLaVA 的成功也催生了一大批同类模型(Qwen-VL、InternVL、GPT-4V 等),它们思路相近:视觉编码器 + 投影 + 大语言模型,差别在视觉编码器的选择、投影层的设计、训练数据的规模。
💡 关键直觉:LLaVA 范式的核心洞察是"图像也是一种 token"。一旦图像被编码成和文本 token 兼容的形式,大语言模型的所有能力都能无缝迁移过来。这比专门设计一个多模态架构要省事得多,也复用了语言模型的规模化红利。当前主流多模态大模型几乎都走这条路。
三代技术不是"新一代淘汰老一代",而是各有擅长的场景:
| 任务 | 推荐技术 | 理由 |
|---|---|---|
| 图文检索(图搜文/文搜图) | CLIP 类双塔 | 检索要快,双塔可预计算,CLIP 最适合 |
| 图像分类、内容审核 | CLIP | 零样本分类,无需重训 |
| 图像描述生成 | BLIP 类 | 专门的描述生成能力 |
| 视觉问答(固定题型) | BLIP 类 | 细粒度理解强 |
| 自由多模态对话 | LLaVA 类 | 复用 LLM 全部能力 |
| 复杂图文推理 | LLaVA 类 | 能结合语言推理 |
一个常见误区是"什么任务都用 LLaVA"。LLaVA 虽然全能,但在纯粹的图文检索上,它反而不如 CLIP 快和准——CLIP 的双塔结构可以预先把图库全编码成向量做毫秒级检索,LLaVA 每次都要跑完整模型,扛不住大规模检索。检索用 CLIP,对话用 LLaVA,是常见的组合。
LLaVA 类模型有个突出问题:幻觉——它会编造图中没有的内容。问它"图里的书叫什么名字",即使图里那本书字看不清,它也可能自信地编一个书名。这源于语言模型的"接龙"本性——它倾向于给出流畅的回答,即使信息不足。
缓解幻觉的几个手段:在提示里强调"如果看不清就说看不清";用自洽采样(多次回答不一致说明不确定);结合专用模型做交叉验证。但根本上,多模态幻觉仍是开放问题,别对 LLaVA 类模型的细节描述盲目信任。
⚠️ 常见坑:用多模态大模型做严肃的事实判断(如医疗影像诊断、法律证据分析)时要格外小心。这类任务对幻觉零容忍,而当前多模态模型的细节感知和可靠性还达不到要求。高风险场景仍以专用模型加人工复核为主,多模态大模型做辅助。
从图像扩展到视频,难度又上一个台阶。视频不仅是多帧图像,还有时序关系——谁先谁后、动作怎么演变。直接把每帧当独立图像处理会丢失时序信息;专门建模时序又大幅增加计算量。
当前视频理解的主流做法是用一个时序采样策略(如均匀抽几帧关键帧),把每帧用图像编码器编码,再用时序模型(如时序注意力)聚合。它的局限是抽帧会丢信息——快速动作可能在抽帧间被跳过。视频理解仍是活跃研究方向,效果远不如图像理解成熟。
训练或微调多模态模型,数据是关键瓶颈。高质量的"图文配对"数据稀缺且昂贵——要人工给图配准确描述。几个数据策略:
数据质量对多模态模型效果影响极大,脏数据训出来的模型幻觉更严重。
多模态模型好不好,评估比纯文本更难——因为"看图"这件事的准确性更主观、更难量化。几个评估维度和对应做法。
第一是事实准确性——模型对图里客观内容的描述对不对。比如图里有三个人,模型说两个,这就是事实错误。这类可以用带标注的基准数据集评估,相对客观。
第二是关系理解——模型有没有看懂图里元素间的关系。"猫在沙发上"和"沙发上有只猫"文字差不多,但模型如果分不清"猫在沙发上"还是"沙发在猫上",就是关系理解错了。这类用专门的视觉关系数据集评估。
第三是幻觉率——模型编造了多少图里没有的东西。这是当前多模态模型最突出的短板,也是评估的重点。专门的幻觉评估基准(如有专门的多模态幻觉数据集)会设计很多诱导幻觉的问题,测模型的"克制能力"。
一个实用的做法是按你的业务场景构造专属评估集。通用基准反映的是平均水平,你的业务图像(图表、文档、产品图、医学影像)可能和通用基准分布差很远,通用基准上的好成绩不一定代表在你业务上好。收集一两百张你的业务图像加标注问题,定期跑评估,比盯通用基准分数更有意义。
💡 关键直觉:多模态模型的能力分布很不均匀——它可能在通用图像理解上很好,但在你特定的业务图像上很差(因为预训练时没见过这类图)。评估一定要覆盖你的真实业务图像,别被通用基准的高分误导。这也是为什么多模态模型往往需要针对业务数据做一轮微调才好用。
入门:用 CLIP 模型做一次图文检索——准备几张图和几句描述,看 CLIP 能不能正确匹配,体会双塔对齐的效果。
进阶:对比用 CLIP(双塔)和一个 LLaVA 类模型做同一个图文任务(如图像描述),体会"检索匹配"和"理解生成"的差异。
挑战:找一个多模态大模型产生幻觉的例子(如它编造了图中没有的细节),分析幻觉的可能来源,思考缓解手段。
下一节我们把三种视觉语言模型架构(双塔、融合、生成式)放一起更系统地对比,给出图文任务的架构选型框架。