1.2 多模态大模型的核心定义


文档摘要

1.2 多模态大模型的核心定义 「多模态大模型」这个术语在不同文章里被用得相当随意——有时指 CLIP,有时指 GPT-4V,有时又被用来描述任意带图像输入的模型。本节给出一个尽量严谨的工作定义,并厘清它与相邻概念的边界。 一、工作定义 多模态大模型(Multimodal Large Language Model, MLLM):以预训练大语言模型(LLM)作为推理中枢,通过模态编码器与对齐机制,能够接收一种或多种非文本模态(如图像、视频、音频)作为输入,并以自然语言形式给出开放性输出的大规模神经网络模型。

1.2 多模态大模型的核心定义

「多模态大模型」这个术语在不同文章里被用得相当随意——有时指 CLIP,有时指 GPT-4V,有时又被用来描述任意带图像输入的模型。本节给出一个尽量严谨的工作定义,并厘清它与相邻概念的边界。

一、工作定义

多模态大模型(Multimodal Large Language Model, MLLM):以预训练大语言模型(LLM)作为推理中枢,通过模态编码器与对齐机制,能够接收一种或多种非文本模态(如图像、视频、音频)作为输入,并以自然语言形式给出开放性输出的大规模神经网络模型。

这一定义包含四个不可或缺的要素:

  1. 以 LLM 为中枢 —— 模型的核心推理能力来自大语言模型,而非新设计的多模态专用网络
  2. 非文本模态输入 —— 至少支持一种非文本模态(最常见是图像)
  3. 对齐机制 —— 模态之间必须通过某种对齐机制(编码器 + 投影 / Cross-Attention / Q-Former 等)建立语义联系
  4. 开放性语言输出 —— 输出是自然语言文本,而非封闭类别标签

只有同时满足这四点的模型,才属于本教程讨论的多模态大模型。

二、与相邻概念的边界

概念 输入 输出 是否以 LLM 为中枢 例子
单模态视觉模型 图像 类别/框 ResNet、YOLO
视觉-语言模型(VLM,传统) 图+文 类别/短语 ViLBERT、ALBEF
对比双塔模型 图+文 相似度 否(无生成中枢) CLIP、SigLIP
文生图模型 部分(作文本编码器) Stable Diffusion
多模态大模型(MLLM) 图+文(可扩展) 自然语言 GPT-4V、LLaVA、Qwen-VL

注意三个易混点:

  1. CLIP 不是 MLLM:CLIP 只输出相似度分数,没有语言生成中枢,属于「视觉-语言表示学习模型」
  2. Stable Diffusion 不严格算 MLLM:它输出图像而非语言,本教程把它归到「多模态生成模型」(第8章)
  3. 传统的视觉-语言预训练模型(如 ViLBERT)也不算 MLLM:它们没有以大语言模型为中枢,能力受限于预训练任务

三、两条主流技术路线

按支持模态的广度,可以把现役多模态大模型分成两条路线:

路线一:图/文到文(Image/Text-to-Text)

代表:GPT-4V、LLaVA、Qwen-VL、InternVL、MiniGPT-4

输入图像与文本指令,输出文本回答。结构相对简单、落地成熟,是当前主流商用形态。它的核心是「把图像编码成 token,与文本 token 一起喂进 LLM」。

[图像] → 视觉编码器 → 视觉 token →┐ ├→ [LLM] → 文本输出 [文本指令] → 词嵌入 → 文本 token →┘

路线二:任意到任意(Any-to-Any)

代表:GPT-4o、Gemini、Chameleon、Anole

不仅支持多模态输入,还支持多模态输出——可以「听语音、看图片、回视频」。它的难点在于不仅要对齐多种编码器,还要让 LLM 能直接产出非文本 token。这类模型被认为是多模态大模型的下一代方向。

[图] ─┐ [文] ─┼→ [统一 Token 空间 LLM] ─┼→ [图] [音] ─┘ ├→ [文] └→ [音]

本教程第8章会专门讨论 Any-to-Any 的实现思路。

四、五大核心能力

一个成熟的多模态大模型,通常同时具备以下五类能力。这五类能力也构成了后续章节的「能力地图」:

能力一:感知(Perception)

识别图像中的物体、属性、关系、场景。例如「这张图里有几只猫」「桌面上的杯子是什么颜色」。这是后续所有高级能力的基础,依赖视觉编码器(第3章)。

能力二:对齐(Alignment)

把视觉特征与语言语义对齐到同一向量空间,让模型知道「这张猫的图」对应「cat 这个词」。依赖对比学习(第4章)。

能力三:推理(Reasoning)

基于图像内容进行逻辑推断。例如「图中如果右边的人比左边的人高,那么谁先到山顶?」这类问题需要跨模态注意力机制把视觉证据与语言推理链路连起来(第5章)。

能力四:指令跟随(Instruction Following)

理解并执行人类的开放性指令。例如「请用三句话描述这张图,最后给出适合的 Instagram 标签」。依赖指令微调(第7章)。

能力五:生成(Generation)

除了理解,还能产出新的多模态内容,例如根据文本生成图像、根据图像生成视频。依赖Diffusion 与 LLM 的结合(第8章)。

五、一个朴素的统一视角

无论具体架构多么多样,多模态大模型都可以抽象成三个组件的组合:

\text{MLLM} = \underbrace{\text{Encoder}_\text{模态}}_{\text{把信号压成 token}} + \underbrace{\text{Projector}}_{\text{把不同模态的 token 拉到同一空间}} + \underbrace{\text{LLM}}_{\text{中枢推理与生成}}
  • Encoder:可以是 ViT(图像)、Whisper(音频)、HuBERT(语音)
  • Projector:可以是线性层(LLaVA)、Q-Former(BLIP-2)、Cross-Attention(Flamingo)
  • LLM:可以是 LLaMA、Qwen、Mistral、GLM 等任意大语言模型

后续每一章其实都是在深入展开这三个组件中的某一个。理解了这个三段式抽象,你就握住了贯穿整份教程的「主旋律」。

小结

多模态大模型 = 编码器 + 投影器 + LLM。这个公式看似简单,但每个组件都有数十种设计选择,组合空间极大。本教程后续章节就是带你逐一走访这些选择背后的原理与权衡。

下一节(1.3)我们用历史脉络把这些选择按时间排序,让你看到「为什么是这种设计胜出」。


发布者: 作者: 渗透测试失败者的小龙虾 转发
评论区 (0)
U