1.2 多模态大模型的核心定义 「多模态大模型」这个术语在不同文章里被用得相当随意——有时指 CLIP,有时指 GPT-4V,有时又被用来描述任意带图像输入的模型。本节给出一个尽量严谨的工作定义,并厘清它与相邻概念的边界。 一、工作定义 多模态大模型(Multimodal Large Language Model, MLLM):以预训练大语言模型(LLM)作为推理中枢,通过模态编码器与对齐机制,能够接收一种或多种非文本模态(如图像、视频、音频)作为输入,并以自然语言形式给出开放性输出的大规模神经网络模型。
「多模态大模型」这个术语在不同文章里被用得相当随意——有时指 CLIP,有时指 GPT-4V,有时又被用来描述任意带图像输入的模型。本节给出一个尽量严谨的工作定义,并厘清它与相邻概念的边界。
多模态大模型(Multimodal Large Language Model, MLLM):以预训练大语言模型(LLM)作为推理中枢,通过模态编码器与对齐机制,能够接收一种或多种非文本模态(如图像、视频、音频)作为输入,并以自然语言形式给出开放性输出的大规模神经网络模型。
这一定义包含四个不可或缺的要素:
只有同时满足这四点的模型,才属于本教程讨论的多模态大模型。
| 概念 | 输入 | 输出 | 是否以 LLM 为中枢 | 例子 |
|---|---|---|---|---|
| 单模态视觉模型 | 图像 | 类别/框 | 否 | ResNet、YOLO |
| 视觉-语言模型(VLM,传统) | 图+文 | 类别/短语 | 否 | ViLBERT、ALBEF |
| 对比双塔模型 | 图+文 | 相似度 | 否(无生成中枢) | CLIP、SigLIP |
| 文生图模型 | 文 | 图 | 部分(作文本编码器) | Stable Diffusion |
| 多模态大模型(MLLM) | 图+文(可扩展) | 自然语言 | 是 | GPT-4V、LLaVA、Qwen-VL |
注意三个易混点:
按支持模态的广度,可以把现役多模态大模型分成两条路线:
代表:GPT-4V、LLaVA、Qwen-VL、InternVL、MiniGPT-4
输入图像与文本指令,输出文本回答。结构相对简单、落地成熟,是当前主流商用形态。它的核心是「把图像编码成 token,与文本 token 一起喂进 LLM」。
[图像] → 视觉编码器 → 视觉 token →┐ ├→ [LLM] → 文本输出 [文本指令] → 词嵌入 → 文本 token →┘
代表:GPT-4o、Gemini、Chameleon、Anole
不仅支持多模态输入,还支持多模态输出——可以「听语音、看图片、回视频」。它的难点在于不仅要对齐多种编码器,还要让 LLM 能直接产出非文本 token。这类模型被认为是多模态大模型的下一代方向。
[图] ─┐ [文] ─┼→ [统一 Token 空间 LLM] ─┼→ [图] [音] ─┘ ├→ [文] └→ [音]
本教程第8章会专门讨论 Any-to-Any 的实现思路。
一个成熟的多模态大模型,通常同时具备以下五类能力。这五类能力也构成了后续章节的「能力地图」:
识别图像中的物体、属性、关系、场景。例如「这张图里有几只猫」「桌面上的杯子是什么颜色」。这是后续所有高级能力的基础,依赖视觉编码器(第3章)。
把视觉特征与语言语义对齐到同一向量空间,让模型知道「这张猫的图」对应「cat 这个词」。依赖对比学习(第4章)。
基于图像内容进行逻辑推断。例如「图中如果右边的人比左边的人高,那么谁先到山顶?」这类问题需要跨模态注意力机制把视觉证据与语言推理链路连起来(第5章)。
理解并执行人类的开放性指令。例如「请用三句话描述这张图,最后给出适合的 Instagram 标签」。依赖指令微调(第7章)。
除了理解,还能产出新的多模态内容,例如根据文本生成图像、根据图像生成视频。依赖Diffusion 与 LLM 的结合(第8章)。
无论具体架构多么多样,多模态大模型都可以抽象成三个组件的组合:
后续每一章其实都是在深入展开这三个组件中的某一个。理解了这个三段式抽象,你就握住了贯穿整份教程的「主旋律」。
多模态大模型 = 编码器 + 投影器 + LLM。这个公式看似简单,但每个组件都有数十种设计选择,组合空间极大。本教程后续章节就是带你逐一走访这些选择背后的原理与权衡。
下一节(1.3)我们用历史脉络把这些选择按时间排序,让你看到「为什么是这种设计胜出」。