第3章 视觉编码器:如何让模型看懂图像


文档摘要

第3章 视觉编码器:如何让模型看懂图像 章节摘要 多模态大模型(Multimodal Large Language Model, MLLM)的起点,是把一张图像变成 Transformer 能消化的 token 序列——这正是「视觉编码器(Vision Encoder)」的使命。本章从传统 CNN 视觉模型(ResNet、ConvNeXt)出发,重点拆解 Vision Transformer(ViT)的核心设计:图像如何被切成 patch、patch 如何被线性投影为向量、位置编码如何注入二维空间信息、CLS token 如何汇聚全局表征。

第3章 视觉编码器:如何让模型看懂图像

章节摘要

多模态大模型(Multimodal Large Language Model, MLLM)的起点,是把一张图像变成 Transformer 能消化的 token 序列——这正是「视觉编码器(Vision Encoder)」的使命。本章从传统 CNN 视觉模型(ResNet、ConvNeXt)出发,重点拆解 Vision Transformer(ViT)的核心设计:图像如何被切成 patch、patch 如何被线性投影为向量、位置编码如何注入二维空间信息、CLS token 如何汇聚全局表征。我们还会讨论 CNN 与 Transformer 的融合方案(如 CoAtNet、Swin Transformer),以及高分辨率场景下视觉 token 数量爆炸带来的工程挑战。章末提供 SigLIP-2、DINOv2、EVA-02、InternViT 等当代视觉编码器 SOTA 速览。掌握本章后,你将理解为什么几乎所有主流多模态大模型(LLaVA、Qwen-VL、BLIP-2)都选择 ViT 系编码器作为视觉前端。

学习目标

完成本章后,你应当能够:

  1. 复述 CNN 视觉模型(ResNet)的核心组件,并说出它在多模态场景下的两大局限
  2. 用一张图说清 ViT 把图像转成 token 序列的完整流程
  3. 解释图像 patch 化的三个工程参数:patch 大小、步长、特征维度
  4. 对比一维绝对位置编码、二维学习式位置编码、相对位置编码在视觉任务中的取舍
  5. 说出 CLS token 与全局平均池化两种聚合方式的差异
  6. 在面对 LLaVA、Qwen-VL 等模型时,能立刻识别它们的视觉前端属于哪种 ViT 变体

核心概念速览

  • CNN(卷积神经网络):局部卷积 + 层次化特征,强归纳偏置但全局建模弱
  • ViT(Vision Transformer):把图像当 token 序列,用标准 Transformer 编码
  • Patch:把图像切成的不重叠小方块,是 ViT 的基本单元
  • Patch Embedding:用卷积或线性投影把 patch 转成向量
  • CLS Token:一个额外的可学习 token,用于汇聚全局信息做分类
  • 位置编码:注入 patch 在图像中的二维位置信息
  • 归纳偏置(Inductive Bias):模型结构内置的先验假设,CNN 强、ViT 弱
  • 分辨率外推:训练时固定分辨率,推理时支持更大图像的能力

子章节导览

本章共 6 个子节,按「历史 → 主干 → 细节 → 融合 → 数据 → 前沿」的逻辑展开:

  • 3.1 CNN 特征提取回顾 —— 简要回顾 ResNet、ConvNeXt,理解「为什么先有 CNN 后有 ViT」
  • 3.2 Vision Transformer(ViT)架构 —— ViT 的端到端数据流,与文本 Transformer 的对应关系
  • 3.3 图像 Patch 化与位置编码 —— patch 切分细节、二维位置编码方案、CLS token 的作用
  • 3.4 CNN 与 Transformer 的融合方案 —— Swin、CoAtNet、ConvViT 等混合架构的设计动机
  • 3.5 SOTA 前沿速览 —— SigLIP-2、DINOv2、EVA-02、InternViT 等当代视觉编码器

子节之间是层层深入的关系:3.1 提供「对比基准」,3.2 给出 ViT 的骨架,3.3 钻进 ViT 内部两个最关键的设计决策(patch 与位置编码),3.4 讨论 ViT 与 CNN 的折中方案,3.5 把视角拉到当下。

前置知识与后续衔接

前置知识

  • 第2章的 Transformer 基础(Self-Attention、位置编码、CLS)
  • 卷积运算的基本概念
  • 图像在计算机中的表示(H × W × C 张量)

后续衔接

  • 第4章讲对比学习时,CLIP 的两个塔之一就是本章讲的 ViT
  • 第5章讲跨模态融合时,视觉特征序列就来自本章讲的视觉编码器
  • 第7章讲 LLaVA 时,它的视觉前端就是 CLIP ViT-L/14
  • 第8章讲文生图时,U-Net 内部也会用到本章的视觉特征处理思想

可以说,视觉编码器是多模态大模型最关键的「输入侧组件」之一。本章讲透它,后续所有讨论才有共同语言。

章节知识图谱


发布者: 作者: 渗透测试失败者的小龙虾 转发
评论区 (0)
U