3.1 CNN 特征提取回顾 在 Vision Transformer 出现之前,计算机视觉几乎被卷积神经网络(CNN)垄断了近十年。要理解 ViT 为什么是革命性的,得先看清楚 CNN 解决了什么、又留下了什么。 一、CNN 的核心思想:局部 + 平移 + 层次 CNN 通过三个关键设计来处理图像: 设计一:局部卷积 每个卷积核只看图像的一个小窗口(如 3×3)。这相比全连接有两个好处: 参数共享:同一个核扫过整张图,参数量与图像大小无关 局部性:契合「图像中重要的模式(边缘、纹理)大多是局部的」这一先验 设计二:平移等变性 同一个物体出现在图像不同位置,卷积的响应相同——这种平移等变性(translation equivariance)让 CNN
在 Vision Transformer 出现之前,计算机视觉几乎被卷积神经网络(CNN)垄断了近十年。要理解 ViT 为什么是革命性的,得先看清楚 CNN 解决了什么、又留下了什么。
CNN 通过三个关键设计来处理图像:
每个卷积核只看图像的一个小窗口(如 3×3)。这相比全连接有两个好处:
同一个物体出现在图像不同位置,卷积的响应相同——这种平移等变性(translation equivariance)让 CNN 天然适合视觉,不用显式学「猫在左上角」和「猫在右下角」是同一个东西。
堆叠多层卷积 + 下采样,CNN 形成层次化的特征金字塔:
浅层:边缘、颜色 中层:纹理、局部模式(眼睛、车轮) 深层:物体部件、整体语义(猫脸、汽车)
这种层次结构与人类视觉皮层类似,是 CNN 强归纳偏置的体现。
2015 年 ResNet 用残差连接解决了「网络越深越难训练」的问题,把网络深度从 VGG 的 19 层推到 152 层,并横扫 ImageNet。
残差块的形式:
其中 F 是两层卷积,x 是输入。这个设计让梯度可以沿捷径反传,从而支持极深的网络。
ResNet 系列直到今天仍是许多任务的「骨干默认选项」:ResNet-50 在 ImageNet 上 top-1 约 76%,参数量 25M,推理速度极快。在工业界那些不需要顶级精度、需要快速部署的场景(如手机端图像分类),ResNet 仍是常见选择。
2022 年 Facebook 提出 ConvNeXt,做了一件有趣的事——把 Swin Transformer 的设计选择逐一移植回 CNN:
结果显示:纯 CNN 也能达到甚至超过同规模 ViT/Swin 的精度。ConvNeXt 的意义是证明了 ViT 的胜利不是因为 Transformer 结构本身有魔力,而是它带来了重新审视 CNN 设计的机会。
虽然 CNN 仍是视觉任务的强基线,但在多模态大模型场景下,它有两大难以克服的局限:
CNN 的感受野是逐层扩大的——浅层只看 3×3,深层才能覆盖整张图。这种局部优先的归纳偏置在分类任务上是优势(不容易过拟合),但在需要全局推理的多模态任务上变成劣势。
例如问「图中右上角的猫与左下角的狗之间有什么关系?」——这类问题需要模型同时聚合远距离区域的特征,CNN 的层次化路径让这种全局关联难以直接建立。
Self-Attention 则相反:任意两个 patch 之间的距离永远是 1,一次矩阵乘法就能完成全局建模。
多模态大模型需要把视觉特征当作 token 喂进 LLM。LLM 内部用的是 Self-Attention,对输入的最自然形式是变长 token 序列。
这种结构上的不匹配,使得 CNN 在多模态大模型时代逐渐被 ViT 取代。即使一些模型(如早期 BLIP)用 CNN 做视觉前端,后来也都切换到了 ViT。
CNN 的核心归纳偏置可以总结为两条:
这两个偏置让 CNN 在小数据下学得快——ImageNet 1K(130 万张图)就能训出很好的模型。
但 ViT 的革命性发现是:当数据规模足够大时(如 ImageNet-21K 或 JFT-300M),归纳偏置反而成了束缚。ViT 抛弃这两个先验,让模型从数据中自己学,反而能达到更高精度。这就是所谓的「scaling 翻盘」。
| 数据规模 | CNN | ViT |
|---|---|---|
| 小(ImageNet-1K) | 更好 | 容易过拟合 |
| 中(ImageNet-21K) | 持平 | 持平 |
| 大(JFT-300M / LAION) | 落后 | 显著领先 |
而多模态大模型时代,互联网级图文对数据(LAION-5B 有 50 亿对)让 ViT 的「大数据优势」可以完全发挥。
虽然 ViT 在多模态大模型里占主导,但 CNN 并未完全消失,几个例外:
所以更准确的说法是:ViT 主导了「视觉理解 + 多模态融合」场景,CNN 在「密集预测 + 生成 + 边缘部署」场景仍占重要位置。
CNN 凭借局部卷积、平移等变、层次化特征三大归纳偏置,在视觉领域统治了近十年。但它的全局建模能力弱、与 LLM 不兼容两大局限,使它在多模态大模型时代让位给了 ViT。同时,CNN 的设计思想(如 ConvNeXt)也对 ViT 的演化产生了反作用力。
下一节(3.2)我们正式拆解 ViT——看它如何用最朴素的方式把 Transformer 搬到图像上。