3.2 AlexNet:把深度学习推上主赛道的里程碑


3.2 AlexNet:把深度学习推上主赛道的里程碑

本节摘要:2012 年,AlexNet 在 ImageNet 大赛上把前五错误率从上一年冠军的约 26% 一下拉到 15.3%,领先第二名十个百分点。结构上它只是"加深加宽的 LeNet",真正的贡献是四件配套工程:ReLU 激活、Dropout 正则、双 GPU 并行训练、数据增强。本节算清它 6,200 万参数的账目,解释这四件武器各治什么病。

为什么一夜之间所有人都在谈深度学习

把时钟拨回 2012 年之前:图像识别的主流是"SIFT 加 SVM"的手工特征流水线,神经网络在多数会议上是边缘话题,够深的网络普遍被认为"训不动"。那一年的 ImageNet 大赛结束时,风向彻底变了——不仅因为冠军错误率断崖式领先,更因为人们发现获胜者的网络结构和十几年前的 LeNet 并无本质区别。原来不是方法不对,是数据不够、算力不足、训练不稳。 AlexNet 用工程手段补齐了这三块,深度学习就此接管图像识别。

学习目标

阅读完本节,你应当能够:

  1. 复算 AlexNet 五层卷积的参数量,指出 6,200 万参数中卷积只占 6%;
  2. 画出它的完整形状走线:227×227 输入如何收敛到 256×6×6 再展平;
  3. 说出 ReLU、Dropout、GPU 并行、数据增强各自解决的瓶颈;
  4. 解释"结构普通、工程制胜"这一判断对今天选型的启示。

一、结构巡检:6,200 万参数的账

AlexNet 的输入是 224 上下的 RGB 大图,骨架五层卷积加三层全连接。逐层把账目列全:

配置 出口形状 参数量
卷积一 11×11 步幅 4 96×55×55 34,944
池化 + 卷积二 5×5 填充 2 256×27×27 614,656
卷积三 3×3 填充 1 384×13×13 885,120
卷积四 3×3 填充 1 384×13×13 1,327,488
卷积五 3×3 填充 1 256×13×13 884,928
全连接一 9,216 进 4,096 37,752,832
全连接二 4,096 16,781,312
全连接三 1,000 类 4,097,000
import torch # 用第二章的公式逐层复算,再汇总 convs = [ (3, 11, 11, 96, 0), (96, 5, 5, 256, 0), (256, 3, 3, 384, 0), (384, 3, 3, 384, 0), (384, 3, 3, 256, 0), ] n_conv = 0 for cin, k, _, cout, _ in convs: n_conv += cin * k * k * cout + cout fcs = [(256 * 6 * 6, 4096), (4096, 4096), (4096, 1000)] n_fc = sum(i * o + o for i, o in fcs) print("卷积部分参数:", f"{n_conv:,}") # 3,747,136 print("全连接部分参数:", f"{n_fc:,}") # 58,631,144 print("总计:", f"{n_conv + n_fc:,}") # 62,378,280 print("全连接占比:", round(n_fc / (n_conv + n_fc) * 100, 1), "%") # 94.0%

账目再次印证那个规律:卷积只扛了 374 万参数(6.0%),九成以上的家当压在三个全连接上——LeNet-5 的病在 larger 尺度上如数复发,而且更重。原因一样:特征图摊平后 9,216 维,连 4,096 个神经元就是三千七百万条线。

二、形状走线与四件武器

把一张 227×227 的图沿流水线走一遍:卷积一(11×11 步幅 4)得 96×55×55,池化到 27;卷积二(5×5 填充 2)得 256×27×27,池化到 13;卷积三到五(3×3 填充 1)保持 13;末次池化到 6,摊平得 256×6×6 = 9,216 维。大核开路、小核收尾的配置是当时的摸索产物,如今只有"首层大核步幅快降"被继承下来(下游流水线详见 6.4 节的现代变体)。

真正让这套结构跑起来的是四件武器。ReLU 替掉饱和激活,正区梯度恒为 1,深层网络收敛速度成倍提升——这是 2.3 节梯度账的直接应用。Dropout 只装在两个大全连接上,训练时随机掐掉一半神经元,逼网络不依赖任何单个通路,把 6,000 万参数的过拟合势头摁住。双 GPU 并行绕开了当年显存 3 GB 的墙,让 6,200 万参数装得下、转得动。数据增强用随机裁剪、水平翻转、颜色扰动把一张图变出无数张"新图",喂饱了参数胃口——这套手法 4.4 节会正式巡检。

两代机型对照速览

把档案柜前两份并排看,脉络自动浮现。参数量:六万对六千二百万,千倍量级差;输入:32×32 灰度手写体对 224 级彩色自然图;激活:饱和的 tanh 系对 ReLU;正则:几乎没有对 Dropout 加数据增强;算力:CPU 可训对双 GPU 才装得下。相同的是骨架——两轮"卷积加下采样"加全连接判决头,一件没换。这张对照表也是读后四章的模板:看任何新机型,先找"哪里没变",再看"哪里变了、为什么变"。

追问两则

问:首层 11×11 步幅 4 的激进配置,后来为什么被淘汰了?答:大步幅早期就把分辨率砍得太狠,小目标的信息在第一站就损失大半;现代网络普遍改用 3×3 或 7×7 配步幅 2,首层更温和,精度换算力更划算。问:论文里的局部响应归一化(LRN)去哪了?答:它是 BN 出现前对"局部响应过强"的手工抑制,收益不稳、实现又贵,批归一化普及后全面退役——读老代码时知道它是历史文物即可。

巡检记录

  • 胜负手不在结构:网络本体是"放大的 LeNet",赢在配套工程——这个判断值得每个想"发明新结构"的人先掂量;
  • 参数账:62,378,280 个参数,卷积 6.0%、全连接 94.0%,分类头病灶加深;
  • 形状走线:227 → 55 → 27 → 13 → 13 → 13 → 6 → 9,216 维,大核快降、小核细描;
  • 四件武器:ReLU 治梯度、Dropout 治过拟合、GPU 治算力、增强治数据——四病四药,缺一不可。

⚠️ 常见误读:把 AlexNet 的爆发归因于"网络更深"。它的深度(八层)放到今天只是玩具级别,真正的遗产是证明"够深 + 够数据 + 够算力 + 训得稳"这套组合拳成立,引来整个行业下注。


作者与出处
原作者: 灏天文库
来源:灏天文库
整理: 灏天文库整理
由灏天文库平台收录,内容或由平台用户上传,仅供学习交流
发布者: 作者: 灏天文库 转发
评论区 (0)
U