卷积神经网络


文档摘要

卷积神经网络 我们之前已经了解到,神经网络在处理图像方面表现得相当不错,即使是一层感知器也能以合理准确度识别MNIST数据集中的手写数字。然而,MNIST数据集非常特殊,所有数字都位于图像中心,这使得任务变得简单。 课前小测验 在现实生活中,我们希望能够在图片中识别出对象,而不受其在图像中确切位置的影响。计算机视觉不同于通用分类,因为当我们试图在图片中找到某个特定对象时,我们实际上是在扫描图像寻找某些特定的模式及其组合。例如,当寻找一只猫时,我们首先可能会寻找水平线,这些线条可以形成胡须,而某些胡须的组合可以告诉我们这实际上是一张猫的照片。相对位置和某些模式的存在是重要的,而不是它们在图像中的确切位置。 为了提取模式,我们将使用卷积滤波器的概念。

卷积神经网络

我们之前已经了解到,神经网络在处理图像方面表现得相当不错,即使是一层感知器也能以合理准确度识别MNIST数据集中的手写数字。然而,MNIST数据集非常特殊,所有数字都位于图像中心,这使得任务变得简单。

课前小测验

在现实生活中,我们希望能够在图片中识别出对象,而不受其在图像中确切位置的影响。计算机视觉不同于通用分类,因为当我们试图在图片中找到某个特定对象时,我们实际上是在扫描图像寻找某些特定的模式及其组合。例如,当寻找一只猫时,我们首先可能会寻找水平线,这些线条可以形成胡须,而某些胡须的组合可以告诉我们这实际上是一张猫的照片。相对位置和某些模式的存在是重要的,而不是它们在图像中的确切位置。

为了提取模式,我们将使用卷积滤波器的概念。如你所知,一张图像由一个二维矩阵或带有色彩深度的三维张量表示。应用滤波器意味着我们采用相对较小的滤波核矩阵,并对原始图像中的每个像素计算加权平均值。我们可以将其视为一个小窗口在整个图像上滑动,并根据滤波核矩阵中的权重对所有像素进行平均。

垂直边缘滤波器 水平边缘滤波器

图片由Dmitry Soshnikov提供

例如,如果我们对MNIST数字应用3x3的垂直边缘和水平边缘滤波器,我们可以在原始图像中存在垂直和水平边缘的地方获得高光(例如,高值)。因此,这两个滤波器可以用于“查找”边缘。类似地,我们可以设计不同的滤波器来查找其他低级模式:

图片来自Leung-Malik滤波器库

然而,虽然我们可以手动设计滤波器来提取某些模式,但也可以设计网络,使其自动学习这些模式。这是卷积神经网络背后的主要思想之一。

卷积神经网络背后的主要思想

卷积神经网络的工作方式基于以下重要思想:

  • 卷积滤波器可以提取模式
  • 我们可以设计网络,使滤波器能够自动训练
  • 我们可以使用相同的方法来查找高级特征中的模式,而不仅仅是原始图像中的模式。因此,卷积神经网络的特征提取工作在特征层次结构上,从低级像素组合开始,到高级别的图像部分组合。

分层特征提取

图片来自Hislop-Lynch的一篇论文,基于他们的研究

✍️ 练习:卷积神经网络

让我们继续探索卷积神经网络的工作原理以及如何实现可训练的滤波器,通过完成相应的笔记本:

金字塔架构

大多数用于图像处理的卷积神经网络遵循所谓的金字塔架构。应用于原始图像的第一个卷积层通常具有相对较低数量的滤波器(8-16个),这些滤波器对应于不同像素组合,如水平/垂直线段。在下一层,我们减少网络的空间维度,并增加滤波器的数量,这对应于简单特征的更多可能组合。随着我们向最终分类器靠近,图像的空间维度减小,滤波器的数量增加。

作为示例,让我们看一下VGG-16的架构,该网络在2014年ImageNet的前五分类中达到了92.7%的准确率:

ImageNet层

ImageNet金字塔

图片来自Researchgate

最著名的卷积神经网络架构

继续了解最著名的卷积神经网络架构

声明:
本文件灏天文库团队进行了翻译。尽管我们力求准确,但请注意,翻译可能包含错误或不准确之处。原文档以其原始语言为准。我们不对因使用此翻译而产生的任何误解或误译负责。


作者与出处
原作者: microsoft
来源:microsoft
许可证:MIT
整理: 灏天文库整理
由灏天文库结构化整理,提供目录导航、全文检索与在线阅读,便于系统化学习
发布者: 作者: microsoft 转发
评论区 (0)
U