1.1 单模态模型的天花板


文档摘要

1.1 单模态模型的天花板 要理解多模态大模型为什么会出现,先得看清单模态模型在哪些地方「撞到了天花板」。本节从三个真实场景切入,再给出共性归纳。 一、场景一:医疗影像中的「看图说不出话」 胸片 X 光片上出现一片阴影。一个训练良好的 ResNet-50 分类模型可以告诉你「这是肺炎的概率 0.87」,但它回答不了医生真正想问的问题: 这片阴影和三年前的旧片比,是变大还是变小? 结合病人主诉「咳嗽两周、发热」,应该优先考虑肺炎还是肺结核? 如果是肺炎,需要排除哪些鉴别诊断? 这些问题都需要把图像与历史报告、检验指标、病人主诉等文本信息联合推理。单模态视觉模型只能输出一个标签,无法把视觉证据与语言推理串联起来。

1.1 单模态模型的天花板

要理解多模态大模型为什么会出现,先得看清单模态模型在哪些地方「撞到了天花板」。本节从三个真实场景切入,再给出共性归纳。

一、场景一:医疗影像中的「看图说不出话」

胸片 X 光片上出现一片阴影。一个训练良好的 ResNet-50 分类模型可以告诉你「这是肺炎的概率 0.87」,但它回答不了医生真正想问的问题:

  • 这片阴影和三年前的旧片比,是变大还是变小?
  • 结合病人主诉「咳嗽两周、发热」,应该优先考虑肺炎还是肺结核?
  • 如果是肺炎,需要排除哪些鉴别诊断?

这些问题都需要把图像与历史报告、检验指标、病人主诉等文本信息联合推理。单模态视觉模型只能输出一个标签,无法把视觉证据与语言推理串联起来。

更深层的问题是:医疗数据天生就是多模态的——影像、报告、电子病历、基因检测结果共同构成一份完整病例。把它们硬塞进一个只能处理像素的模型,相当于让人闭着一只眼睛去做手术。

二、场景二:自动驾驶中的「看得到但讲不清」

自动驾驶感知模型可以输出「前方 30 米有一辆红色轿车」。但当系统出现误判引发事故,工程师需要排查时,模型却无法解释

  • 它为什么认为这是「轿车」而不是「货车」?
  • 它是基于哪个像素区域下的判断?
  • 它对识别结果有多大的不确定性?

这种「会分类但不会解释」的特性,让单模态感知模型在安全关键场景下难以被审计。如果模型能用自然语言说出「我看到一个红色金属反光物体,轮廓像轿车,但车顶高度异常,建议人类复核」,整个系统的可信度就会大幅提升。

这正是多模态大模型在自动驾驶、工业质检等高风险领域备受关注的原因——生成式语言输出天然带有可解释性

三、场景三:内容审核中的「图文不同步」

社交媒体上一张图片配文「今天天气真好」,但图片里实际是暴力内容。如果用:

  • 纯视觉模型:可能识别出「打斗」类目标,但对配文一无所知
  • 纯文本模型:看到「天气真好」会判定为安全内容
  • 两者各自决策、再投票:很可能因为文本置信度高而被放过

正确的做法是联合理解图文语义:判断图片内容与配文是否一致、是否存在讽刺或反讽。这要求模型能同时接收图像与文本,并在两者之间建立关联。单模态模型在架构层面就缺少这种「跨模态关联」的能力。

四、共性归纳:单模态模型的三类根本困境

把上面三个场景抽象出来,可以看到单模态模型存在三类共性困境:

困境一:信号不完整

现实世界的信息本来就跨多个模态传递。任何单一模态都是真实信号的有损投影

\text{真实世界} \xrightarrow{\text{有损采样}} \begin{cases} \text{图像} \\ \text{文本} \\ \text{音频} \\ \text{视频} \end{cases}

只用一个模态,相当于在三维世界上只看一维投影,必然会丢失信息。

困境二:能力不通用

单模态模型的能力边界由训练任务决定

  • 训练来分类猫狗的 ResNet,不会回答「这张图里有什么故事」
  • 训练来生成文本的 GPT,看不懂任何图像
  • 训练来做语音识别的 Conformer,做不了情绪分析

每加一个任务,就要重新标注数据、重新训练模型。这种任务孤岛让工程成本爆炸。

困境三:交互不自然

人类与机器的最自然交互方式是自然语言。但单模态视觉模型只能输入图像、输出标签,无法承接「请帮我描述这张图」「图里的人大概几岁」这类开放指令。这种交互鸿沟让模型离真正的「智能助手」始终隔着一层。

五、为什么是「现在」突破

单模态困境其实早已存在,之所以在 2022 年后才被大规模突破,是因为三个条件同时成熟:

  1. Transformer 通用化 —— 同一个算子既能处理文本也能处理图像(第2、3章详解)
  2. 互联网级图文对数据 —— LAION-5B 等数据集提供了数十亿规模的图文对(第4、6章详解)
  3. 大语言模型涌现 —— GPT-3.5/4 等大模型展现出强零样本与指令跟随能力,为「以语言为中枢」的多模态架构提供了底座(第7章详解)

小结

单模态模型不是「不够强」,而是架构上就不适合解决跨模态问题。无论再加多少层数、扩多少参数,都跨不过「信号不完整、能力不通用、交互不自然」这三道坎。多模态大模型的目标,正是在架构层面把这些坎填平。

下一节(1.2)我们将给出多模态大模型的严格定义,并厘清它与相关概念的边界。


发布者: 作者: 渗透测试失败者的小龙虾 转发
评论区 (0)
U