3.1 CNN 特征提取回顾


文档摘要

3.1 CNN 特征提取回顾 在 Vision Transformer 出现之前,计算机视觉几乎被卷积神经网络(CNN)垄断了近十年。要理解 ViT 为什么是革命性的,得先看清楚 CNN 解决了什么、又留下了什么。 一、CNN 的核心思想:局部 + 平移 + 层次 CNN 通过三个关键设计来处理图像: 设计一:局部卷积 每个卷积核只看图像的一个小窗口(如 3×3)。这相比全连接有两个好处: 参数共享:同一个核扫过整张图,参数量与图像大小无关 局部性:契合「图像中重要的模式(边缘、纹理)大多是局部的」这一先验 设计二:平移等变性 同一个物体出现在图像不同位置,卷积的响应相同——这种平移等变性(translation equivariance)让 CNN

3.1 CNN 特征提取回顾

在 Vision Transformer 出现之前,计算机视觉几乎被卷积神经网络(CNN)垄断了近十年。要理解 ViT 为什么是革命性的,得先看清楚 CNN 解决了什么、又留下了什么。

一、CNN 的核心思想:局部 + 平移 + 层次

CNN 通过三个关键设计来处理图像:

设计一:局部卷积

每个卷积核只看图像的一个小窗口(如 3×3)。这相比全连接有两个好处:

  • 参数共享:同一个核扫过整张图,参数量与图像大小无关
  • 局部性:契合「图像中重要的模式(边缘、纹理)大多是局部的」这一先验

设计二:平移等变性

同一个物体出现在图像不同位置,卷积的响应相同——这种平移等变性(translation equivariance)让 CNN 天然适合视觉,不用显式学「猫在左上角」和「猫在右下角」是同一个东西。

设计三:层次化特征

堆叠多层卷积 + 下采样,CNN 形成层次化的特征金字塔:

浅层:边缘、颜色 中层:纹理、局部模式(眼睛、车轮) 深层:物体部件、整体语义(猫脸、汽车)

这种层次结构与人类视觉皮层类似,是 CNN 强归纳偏置的体现。

二、ResNet:深度学习的里程碑

2015 年 ResNet 用残差连接解决了「网络越深越难训练」的问题,把网络深度从 VGG 的 19 层推到 152 层,并横扫 ImageNet。

残差块的形式:

y = F(x, W) + x

其中 F 是两层卷积,x 是输入。这个设计让梯度可以沿捷径反传,从而支持极深的网络。

ResNet 系列直到今天仍是许多任务的「骨干默认选项」:ResNet-50 在 ImageNet 上 top-1 约 76%,参数量 25M,推理速度极快。在工业界那些不需要顶级精度、需要快速部署的场景(如手机端图像分类),ResNet 仍是常见选择。

三、ConvNeXt:CNN 的回马枪

2022 年 Facebook 提出 ConvNeXt,做了一件有趣的事——把 Swin Transformer 的设计选择逐一移植回 CNN

  • 大卷积核(7×7)替代小卷积堆叠
  • 用 GELU 替代 ReLU
  • 用 LayerNorm 替代 BatchNorm
  • 减少激活与归一化的使用频率

结果显示:纯 CNN 也能达到甚至超过同规模 ViT/Swin 的精度。ConvNeXt 的意义是证明了 ViT 的胜利不是因为 Transformer 结构本身有魔力,而是它带来了重新审视 CNN 设计的机会。

四、CNN 在多模态场景下的两大局限

虽然 CNN 仍是视觉任务的强基线,但在多模态大模型场景下,它有两大难以克服的局限:

局限一:全局建模能力弱

CNN 的感受野是逐层扩大的——浅层只看 3×3,深层才能覆盖整张图。这种局部优先的归纳偏置在分类任务上是优势(不容易过拟合),但在需要全局推理的多模态任务上变成劣势。

例如问「图中右上角的猫与左下角的狗之间有什么关系?」——这类问题需要模型同时聚合远距离区域的特征,CNN 的层次化路径让这种全局关联难以直接建立。

Self-Attention 则相反:任意两个 patch 之间的距离永远是 1,一次矩阵乘法就能完成全局建模。

局限二:与 LLM 不兼容

多模态大模型需要把视觉特征当作 token 喂进 LLM。LLM 内部用的是 Self-Attention,对输入的最自然形式是变长 token 序列

  • ViT 输出的就是 token 序列,可以直接拼接进 LLM
  • CNN 输出的是空间特征图(H' × W' × C),需要额外展平或池化才能转成序列

这种结构上的不匹配,使得 CNN 在多模态大模型时代逐渐被 ViT 取代。即使一些模型(如早期 BLIP)用 CNN 做视觉前端,后来也都切换到了 ViT。

五、CNN 的归纳偏置:是优势也是束缚

CNN 的核心归纳偏置可以总结为两条:

  1. 局部性:相邻像素关系最紧密
  2. 平移等变性:物体位置变化不影响识别

这两个偏置让 CNN 在小数据下学得快——ImageNet 1K(130 万张图)就能训出很好的模型。

但 ViT 的革命性发现是:当数据规模足够大时(如 ImageNet-21K 或 JFT-300M),归纳偏置反而成了束缚。ViT 抛弃这两个先验,让模型从数据中自己学,反而能达到更高精度。这就是所谓的「scaling 翻盘」。

数据规模 CNN ViT
小(ImageNet-1K) 更好 容易过拟合
中(ImageNet-21K) 持平 持平
大(JFT-300M / LAION) 落后 显著领先

而多模态大模型时代,互联网级图文对数据(LAION-5B 有 50 亿对)让 ViT 的「大数据优势」可以完全发挥。

六、CNN 没有完全退出舞台

虽然 ViT 在多模态大模型里占主导,但 CNN 并未完全消失,几个例外:

  • 轻量级边缘部署:MobileNet、EfficientNet 在手机、IoT 设备上仍是首选
  • 密集预测任务:分割、检测等任务里,U-Net、FPN 等基于 CNN 的架构仍是强基线
  • 视频理解:3D CNN(如 I3D、SlowFast)在动作识别里仍广泛使用
  • 文生图 U-Net:Stable Diffusion 的核心去噪网络就是基于 CNN 的 U-Net(第8章详解)

所以更准确的说法是:ViT 主导了「视觉理解 + 多模态融合」场景,CNN 在「密集预测 + 生成 + 边缘部署」场景仍占重要位置

小结

CNN 凭借局部卷积、平移等变、层次化特征三大归纳偏置,在视觉领域统治了近十年。但它的全局建模能力弱、与 LLM 不兼容两大局限,使它在多模态大模型时代让位给了 ViT。同时,CNN 的设计思想(如 ConvNeXt)也对 ViT 的演化产生了反作用力。

下一节(3.2)我们正式拆解 ViT——看它如何用最朴素的方式把 Transformer 搬到图像上。


发布者: 作者: 渗透测试失败者的小龙虾 转发
评论区 (0)
U