1.1 单模态模型的天花板 要理解多模态大模型为什么会出现,先得看清单模态模型在哪些地方「撞到了天花板」。本节从三个真实场景切入,再给出共性归纳。 一、场景一:医疗影像中的「看图说不出话」 胸片 X 光片上出现一片阴影。一个训练良好的 ResNet-50 分类模型可以告诉你「这是肺炎的概率 0.87」,但它回答不了医生真正想问的问题: 这片阴影和三年前的旧片比,是变大还是变小? 结合病人主诉「咳嗽两周、发热」,应该优先考虑肺炎还是肺结核? 如果是肺炎,需要排除哪些鉴别诊断? 这些问题都需要把图像与历史报告、检验指标、病人主诉等文本信息联合推理。单模态视觉模型只能输出一个标签,无法把视觉证据与语言推理串联起来。
要理解多模态大模型为什么会出现,先得看清单模态模型在哪些地方「撞到了天花板」。本节从三个真实场景切入,再给出共性归纳。
胸片 X 光片上出现一片阴影。一个训练良好的 ResNet-50 分类模型可以告诉你「这是肺炎的概率 0.87」,但它回答不了医生真正想问的问题:
这些问题都需要把图像与历史报告、检验指标、病人主诉等文本信息联合推理。单模态视觉模型只能输出一个标签,无法把视觉证据与语言推理串联起来。
更深层的问题是:医疗数据天生就是多模态的——影像、报告、电子病历、基因检测结果共同构成一份完整病例。把它们硬塞进一个只能处理像素的模型,相当于让人闭着一只眼睛去做手术。
自动驾驶感知模型可以输出「前方 30 米有一辆红色轿车」。但当系统出现误判引发事故,工程师需要排查时,模型却无法解释:
这种「会分类但不会解释」的特性,让单模态感知模型在安全关键场景下难以被审计。如果模型能用自然语言说出「我看到一个红色金属反光物体,轮廓像轿车,但车顶高度异常,建议人类复核」,整个系统的可信度就会大幅提升。
这正是多模态大模型在自动驾驶、工业质检等高风险领域备受关注的原因——生成式语言输出天然带有可解释性。
社交媒体上一张图片配文「今天天气真好」,但图片里实际是暴力内容。如果用:
正确的做法是联合理解图文语义:判断图片内容与配文是否一致、是否存在讽刺或反讽。这要求模型能同时接收图像与文本,并在两者之间建立关联。单模态模型在架构层面就缺少这种「跨模态关联」的能力。
把上面三个场景抽象出来,可以看到单模态模型存在三类共性困境:
现实世界的信息本来就跨多个模态传递。任何单一模态都是真实信号的有损投影:
只用一个模态,相当于在三维世界上只看一维投影,必然会丢失信息。
单模态模型的能力边界由训练任务决定:
每加一个任务,就要重新标注数据、重新训练模型。这种任务孤岛让工程成本爆炸。
人类与机器的最自然交互方式是自然语言。但单模态视觉模型只能输入图像、输出标签,无法承接「请帮我描述这张图」「图里的人大概几岁」这类开放指令。这种交互鸿沟让模型离真正的「智能助手」始终隔着一层。
单模态困境其实早已存在,之所以在 2022 年后才被大规模突破,是因为三个条件同时成熟:
单模态模型不是「不够强」,而是架构上就不适合解决跨模态问题。无论再加多少层数、扩多少参数,都跨不过「信号不完整、能力不通用、交互不自然」这三道坎。多模态大模型的目标,正是在架构层面把这些坎填平。
下一节(1.2)我们将给出多模态大模型的严格定义,并厘清它与相关概念的边界。