著名的CNN架构 VGG-16 VGG-16 是在2014年ImageNet顶级分类比赛中达到92.7%准确率的网络。它具有以下层结构: ImageNet 层 如你所见,VGG遵循传统的金字塔架构,即一系列卷积-池化层。 ImageNet 锥体 图片来自 Researchgate ResNet ResNet 是微软研究院在2015年提出的模型家族。ResNet的主要思想是使用残差块: 图片来自 这篇论文 使用恒等映射的原因是为了让层预测前一层输出与残差块输出之间的差异——这也是为什么叫“残差”的原因。这些块更容易训练,并且可以构建包含数百个这样的块的网络(最常见的变种包括ResNet-52、ResNet-101和ResNet-152)。 你也可以认为这个网络能够根据数据集调整其复杂度。
VGG-16 是在2014年ImageNet顶级分类比赛中达到92.7%准确率的网络。它具有以下层结构:

如你所见,VGG遵循传统的金字塔架构,即一系列卷积-池化层。

图片来自 Researchgate
ResNet 是微软研究院在2015年提出的模型家族。ResNet的主要思想是使用残差块:
图片来自 这篇论文
使用恒等映射的原因是为了让层预测前一层输出与残差块输出之间的差异——这也是为什么叫“残差”的原因。这些块更容易训练,并且可以构建包含数百个这样的块的网络(最常见的变种包括ResNet-52、ResNet-101和ResNet-152)。
你也可以认为这个网络能够根据数据集调整其复杂度。开始训练时,权重值较小,大部分信号通过恒等映射层传递。随着训练进行,权重变大,网络参数的重要性增加,网络会调整以适应所需的表达能力,从而正确分类训练图像。
Google Inception 架构将这一想法更进一步,将每一层构建为多种不同路径的组合:
图片来自 Researchgate
这里,我们需要强调1x1卷积的作用,因为一开始它们似乎没有意义。为什么我们需要用1x1滤波器遍历整个图像?然而,你需要记住卷积滤波器也作用于多个深度通道(最初是RGB颜色,在后续层中是不同滤波器的通道),1x1卷积用于利用不同的可训练权重混合这些输入通道。它还可以被视为对通道维度的下采样(池化)。
MobileNet 是适合移动设备的小型模型家族。如果你资源有限,并且可以牺牲一点精度,可以使用它们。它们背后的主要思想是所谓的深度可分离卷积,这种方法允许通过空间卷积和深度通道上的1x1卷积的组合来表示卷积滤波器。这显著减少了参数数量,使网络更小,并且更容易用较少的数据进行训练。
这是一个关于MobileNet的很好的博客文章。
在这节课中,你已经了解了计算机视觉神经网络背后的主要概念——卷积网络。驱动图像分类、目标检测甚至图像生成网络的实际架构都是基于CNN的,只是层数更多并且有一些额外的训练技巧。
在配套的笔记本中,底部有如何获得更高准确率的注释。做一些实验看看是否可以实现更高的准确率。
虽然CNN最常用于计算机视觉任务,但它们通常也适用于提取固定大小的模式。例如,如果我们处理声音,我们也可能想使用CNN来查找音频信号中的某些特定模式——在这种情况下滤波器将是1维的(这种CNN被称为1D-CNN)。另外,有时使用3D-CNN来提取多维空间中的特征,比如视频中的某些事件——CNN可以捕捉到随时间变化的特征模式。做一些复习和自学,了解CNN可以完成的其他任务。
在这个实验中,你的任务是分类不同的猫和狗品种。这些图像比MNIST数据集更复杂,维度更高,并且有超过10个类别。
声明:
本文件灏天文库团队进行了翻译。尽管我们力求准确,但请注意,翻译可能包含错误或不准确之处。原文档以其原始语言为准。我们不对因使用此翻译而产生的任何误解或误译负责。