第3章 视觉编码器:如何让模型看懂图像 章节摘要 多模态大模型(Multimodal Large Language Model, MLLM)的起点,是把一张图像变成 Transformer 能消化的 token 序列——这正是「视觉编码器(Vision Encoder)」的使命。本章从传统 CNN 视觉模型(ResNet、ConvNeXt)出发,重点拆解 Vision Transformer(ViT)的核心设计:图像如何被切成 patch、patch 如何被线性投影为向量、位置编码如何注入二维空间信息、CLS token 如何汇聚全局表征。
多模态大模型(Multimodal Large Language Model, MLLM)的起点,是把一张图像变成 Transformer 能消化的 token 序列——这正是「视觉编码器(Vision Encoder)」的使命。本章从传统 CNN 视觉模型(ResNet、ConvNeXt)出发,重点拆解 Vision Transformer(ViT)的核心设计:图像如何被切成 patch、patch 如何被线性投影为向量、位置编码如何注入二维空间信息、CLS token 如何汇聚全局表征。我们还会讨论 CNN 与 Transformer 的融合方案(如 CoAtNet、Swin Transformer),以及高分辨率场景下视觉 token 数量爆炸带来的工程挑战。章末提供 SigLIP-2、DINOv2、EVA-02、InternViT 等当代视觉编码器 SOTA 速览。掌握本章后,你将理解为什么几乎所有主流多模态大模型(LLaVA、Qwen-VL、BLIP-2)都选择 ViT 系编码器作为视觉前端。
完成本章后,你应当能够:
本章共 6 个子节,按「历史 → 主干 → 细节 → 融合 → 数据 → 前沿」的逻辑展开:
子节之间是层层深入的关系:3.1 提供「对比基准」,3.2 给出 ViT 的骨架,3.3 钻进 ViT 内部两个最关键的设计决策(patch 与位置编码),3.4 讨论 ViT 与 CNN 的折中方案,3.5 把视角拉到当下。
前置知识:
后续衔接:
可以说,视觉编码器是多模态大模型最关键的「输入侧组件」之一。本章讲透它,后续所有讨论才有共同语言。