4.1 多模态大模型演进


文档摘要

4.1 多模态大模型演进 本节摘要:让机器看懂图、理解视频,是自然语言理解向多模态延伸的核心。本节梳理从 CLIP 到 BLIP 再到 LLaVA 的三代多模态大模型演进——CLIP 用对比学习把图文对齐到同一空间,BLIP 引入融合理解能力,LLaVA 把视觉编码器直接接进大语言模型实现多模态对话。理解这条演进线,就能看清当前图文任务该用哪种技术,以及每种技术的天花板在哪。 先说结论 阅读完本节,你应当能够: 说清 CLIP 用对比学习对齐图文空间的原理,以及它为什么引爆了多模态领域 解释 BLIP 相对 CLIP 多了什么能力(融合理解、生成) 描述 LLaVA 如何把视觉能力接入大语言模型,开启多模态对话 判断一类图文任务该用哪一代技术 一、问题与直觉

4.1 多模态大模型演进

本节摘要:让机器看懂图、理解视频,是自然语言理解向多模态延伸的核心。本节梳理从 CLIP 到 BLIP 再到 LLaVA 的三代多模态大模型演进——CLIP 用对比学习把图文对齐到同一空间,BLIP 引入融合理解能力,LLaVA 把视觉编码器直接接进大语言模型实现多模态对话。理解这条演进线,就能看清当前图文任务该用哪种技术,以及每种技术的天花板在哪。

先说结论

阅读完本节,你应当能够:

  1. 说清 CLIP 用对比学习对齐图文空间的原理,以及它为什么引爆了多模态领域
  2. 解释 BLIP 相对 CLIP 多了什么能力(融合理解、生成)
  3. 描述 LLaVA 如何把视觉能力接入大语言模型,开启多模态对话
  4. 判断一类图文任务该用哪一代技术

一、问题与直觉

让计算机"看图说话"这件事,听上去简单,难了二三十年。早期的做法是先把图像识别成一组标签("猫""沙发""室内"),再把标签拼成句子——结果是机械、生硬、丢失关系的描述("一只猫,一个沙发")。问题在于图像和语言是两个完全不同的信号,硬要把图像先翻译成离散标签再接语言,中间损失太大。

真正的突破来自一个关键洞察:与其在图像和语言之间架一座"翻译桥",不如让它们直接学习同一个语义空间。一张猫的图片和"一只猫"这句话,如果能在同一个向量空间里被映射到相近的位置,那图像和语言就天然"对齐"了——这是 CLIP 的核心思想,也是现代多模态的起点。

从 CLIP 往后,多模态大模型沿着"对齐 → 融合 → 生成"三步走:先对齐(CLIP 让图文能比较),再融合(BLIP 让模型能深度理解图文关系),再生成(LLaVA 让模型能基于图像自由对话)。这一节我们就顺着这条线讲。

二、核心原理

2.1 第一代:CLIP 与对比学习对齐

CLIP(Contrastive Language-Image Pre-training)2021 年问世,是现代多模态的奠基之作。它的核心做法是对比学习:用海量"图像-文本"配对(比如一张猫的图配"一只橘猫坐在窗台上"这句话),训练两个编码器——图像编码器和文本编码器——让配对的图文在向量空间里靠近,不配对的远离。

训练完,CLIP 得到两个对齐的编码器。给它一张图和一句话,它能算出两者有多匹配;给它一张图,它能在候选句子里找出最贴切的描述;给它一句话,它能在图片库里找出最匹配的图。这就是跨模态检索的能力——图搜文、文搜图都通了。

CLIP 的革命性在于它证明了:只要有足够多的图文配对(CLIP 用了 4 亿对),不需要人工标注,模型就能自动学会图文的对齐关系。这绕开了传统方法依赖人工标签的瓶颈,让多模态第一次具备了大规模落地的可能。

但 CLIP 也有明显局限。它本质是个"匹配"模型——判断图文配不配,但不理解图里的细节关系。问它"图里的猫在沙发左边还是右边""猫的眼睛是什么颜色",CLIP 答不好,因为对比学习只学了整体匹配,没学细粒度的图文关系。

2.2 第二代:BLIP 与融合理解

BLIP(Bootstrapping Language-Image Pre-training)针对 CLIP 的局限,引入了图文融合能力。它不再只是把图和文分别编码再算相似度(双塔),而是让图像特征和文本特征在一个模型里深度交互(交叉注意力),从而理解"图里的哪个区域对应文里的哪个词"这种细粒度关系。

图 多模态三代演进:从对齐到融合到生成

下面这张图把 CLIP、BLIP、LLaVA 三代的架构差异和能做的事画在一起,演进逻辑一目了然。

图 多模态三代演进:从对齐到融合到生成

BLIP 还有一个重要贡献是能生成图像描述(captioning)——给一张图,它能输出一段描述性的文字。这超出了 CLIP 只能"判断匹配"的范围,进入了"理解后表达"的阶段。BLIP 的视觉问答(VQA)能力也更强——给一张图问问题,它能基于对图的理解作答。

2.3 第三代:LLaVA 与多模态对话

LLaVA(Large Language and Vision Assistant)代表了当前的主流方向:把视觉能力直接接入大语言模型。它的做法很巧妙——用一个预训练好的视觉编码器(通常是 CLIP 的 ViT)提取图像特征,通过一个投影层把图像特征对齐到语言模型的词向量空间,然后像处理文本 token 一样,把图像 token 和文本 token 一起喂给大语言模型。

这样做的好处是,语言模型原本的全部能力(推理、对话、遵循指令)都直接复用到了多模态上。模型既能看图,又能用语言模型的能力对图进行推理和对话——这是 CLIP 和 BLIP 这种专用架构做不到的。LLaVA 开启了"多模态对话"的时代:你发张图问"这道菜大概多少卡路里""这张图表说明什么趋势",它能像聊天一样回答。

LLaVA 的成功也催生了一大批同类模型(Qwen-VL、InternVL、GPT-4V 等),它们思路相近:视觉编码器 + 投影 + 大语言模型,差别在视觉编码器的选择、投影层的设计、训练数据的规模。

💡 关键直觉:LLaVA 范式的核心洞察是"图像也是一种 token"。一旦图像被编码成和文本 token 兼容的形式,大语言模型的所有能力都能无缝迁移过来。这比专门设计一个多模态架构要省事得多,也复用了语言模型的规模化红利。当前主流多模态大模型几乎都走这条路。

三、工程实践要点

3.1 按任务选代际

三代技术不是"新一代淘汰老一代",而是各有擅长的场景:

任务 推荐技术 理由
图文检索(图搜文/文搜图) CLIP 类双塔 检索要快,双塔可预计算,CLIP 最适合
图像分类、内容审核 CLIP 零样本分类,无需重训
图像描述生成 BLIP 类 专门的描述生成能力
视觉问答(固定题型) BLIP 类 细粒度理解强
自由多模态对话 LLaVA 类 复用 LLM 全部能力
复杂图文推理 LLaVA 类 能结合语言推理

一个常见误区是"什么任务都用 LLaVA"。LLaVA 虽然全能,但在纯粹的图文检索上,它反而不如 CLIP 快和准——CLIP 的双塔结构可以预先把图库全编码成向量做毫秒级检索,LLaVA 每次都要跑完整模型,扛不住大规模检索。检索用 CLIP,对话用 LLaVA,是常见的组合。

3.2 多模态幻觉问题

LLaVA 类模型有个突出问题:幻觉——它会编造图中没有的内容。问它"图里的书叫什么名字",即使图里那本书字看不清,它也可能自信地编一个书名。这源于语言模型的"接龙"本性——它倾向于给出流畅的回答,即使信息不足。

缓解幻觉的几个手段:在提示里强调"如果看不清就说看不清";用自洽采样(多次回答不一致说明不确定);结合专用模型做交叉验证。但根本上,多模态幻觉仍是开放问题,别对 LLaVA 类模型的细节描述盲目信任。

⚠️ 常见坑:用多模态大模型做严肃的事实判断(如医疗影像诊断、法律证据分析)时要格外小心。这类任务对幻觉零容忍,而当前多模态模型的细节感知和可靠性还达不到要求。高风险场景仍以专用模型加人工复核为主,多模态大模型做辅助。

3.3 视频理解的额外挑战

从图像扩展到视频,难度又上一个台阶。视频不仅是多帧图像,还有时序关系——谁先谁后、动作怎么演变。直接把每帧当独立图像处理会丢失时序信息;专门建模时序又大幅增加计算量。

当前视频理解的主流做法是用一个时序采样策略(如均匀抽几帧关键帧),把每帧用图像编码器编码,再用时序模型(如时序注意力)聚合。它的局限是抽帧会丢信息——快速动作可能在抽帧间被跳过。视频理解仍是活跃研究方向,效果远不如图像理解成熟。

3.4 多模态数据准备

训练或微调多模态模型,数据是关键瓶颈。高质量的"图文配对"数据稀缺且昂贵——要人工给图配准确描述。几个数据策略:

  • 利用现有大规模图文数据集(如 LAION、CC3M),但质量参差,要清洗
  • 用强模型生成合成描述(用 GPT-4V 给图生成描述作为训练数据),注意质量控制
  • 针对下游任务构造专用数据(如你的业务里特有的图表、文档图像)

数据质量对多模态模型效果影响极大,脏数据训出来的模型幻觉更严重。

3.5 多模态能力的评估

多模态模型好不好,评估比纯文本更难——因为"看图"这件事的准确性更主观、更难量化。几个评估维度和对应做法。

第一是事实准确性——模型对图里客观内容的描述对不对。比如图里有三个人,模型说两个,这就是事实错误。这类可以用带标注的基准数据集评估,相对客观。

第二是关系理解——模型有没有看懂图里元素间的关系。"猫在沙发上"和"沙发上有只猫"文字差不多,但模型如果分不清"猫在沙发上"还是"沙发在猫上",就是关系理解错了。这类用专门的视觉关系数据集评估。

第三是幻觉率——模型编造了多少图里没有的东西。这是当前多模态模型最突出的短板,也是评估的重点。专门的幻觉评估基准(如有专门的多模态幻觉数据集)会设计很多诱导幻觉的问题,测模型的"克制能力"。

一个实用的做法是按你的业务场景构造专属评估集。通用基准反映的是平均水平,你的业务图像(图表、文档、产品图、医学影像)可能和通用基准分布差很远,通用基准上的好成绩不一定代表在你业务上好。收集一两百张你的业务图像加标注问题,定期跑评估,比盯通用基准分数更有意义。

💡 关键直觉:多模态模型的能力分布很不均匀——它可能在通用图像理解上很好,但在你特定的业务图像上很差(因为预训练时没见过这类图)。评估一定要覆盖你的真实业务图像,别被通用基准的高分误导。这也是为什么多模态模型往往需要针对业务数据做一轮微调才好用。

四、分层练习

入门:用 CLIP 模型做一次图文检索——准备几张图和几句描述,看 CLIP 能不能正确匹配,体会双塔对齐的效果。

进阶:对比用 CLIP(双塔)和一个 LLaVA 类模型做同一个图文任务(如图像描述),体会"检索匹配"和"理解生成"的差异。

挑战:找一个多模态大模型产生幻觉的例子(如它编造了图中没有的细节),分析幻觉的可能来源,思考缓解手段。

要点速记

  • CLIP 用对比学习把图文对齐到同一空间,开启了跨模态检索,但只做整体匹配、不理解细粒度关系。
  • BLIP 引入图文融合(交叉注意力),能做细粒度理解和图像描述生成,但生成能力有限。
  • LLaVA 把视觉编码器接入大语言模型,复用 LLM 全部能力实现多模态对话,是当前主流。
  • 三代不是淘汰关系而是各有擅长:检索用 CLIP,理解用 BLIP,对话用 LLaVA。
  • 多模态幻觉是突出难题,LLaVA 类会编造图中没有的内容,高风险场景不能盲目信任。
  • 视频理解比图像更难,要建模时序,抽帧会丢信息,效果远不如图像成熟。
  • 多模态数据质量决定效果,脏数据加剧幻觉,合成数据要严格清洗。

下一节我们把三种视觉语言模型架构(双塔、融合、生成式)放一起更系统地对比,给出图文任务的架构选型框架。


作者与出处
原作者: 灏天文库智能体
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库智能体 转发
评论区 (0)
U