用于视觉识别的深度卷积网络中的空间金字塔池化

一壶浊酒..

已于 2022-10-31 20:44:49 修改

阅读量631

点赞数 1

分类专栏：深度学习文章标签：深度学习人工智能神经网络

于 2022-10-31 20:38:47 首次发布

本文链接：https://blog.csdn.net/qq_40107571/article/details/127620705

版权

深度学习专栏收录该内容

100 篇文章 12 订阅 ¥49.90 ¥99.00

订阅专栏

超级会员免费看

本文介绍了一种解决深度卷积神经网络（CNNs）输入图像尺寸固定问题的方法——空间金字塔池（SPP）层。SPP层在CNN的卷积层和全连接层之间引入信息聚合，允许网络接受不同尺寸的输入图像，同时保持全连接层的固定长度输出。通过多尺度池化，SPP增强了网络对对象变形的鲁棒性，提高了识别精度。

摘要由CSDN通过智能技术生成

引言

我们目睹了视觉领域的快速，革命性变化，主要是由深度卷积神经网络 (CNNs) [18] 和大规模训练数据的可用性 [6] 引起的。基于深度网络的方法最近在图像分类 [16、31、24]，对象检测 [12、444、24]，许多其他识别任务 [22、27、32、13]，甚至非识别任务的现有技术上有了很大的改进。

然而，在训练和测试cnn中存在一个技术问题: 普遍的cnn需要固定的输入图像尺寸 (例如，224 × 224)，这限制了输入图像的纵横比和比例。当应用于任意大小的图像时，当前的方法大多通过裁剪将输入图像拟合到固定大小，如图1 (上) 所示。但是裁剪的区域可能不包含整个对象，而扭曲的内容可能会导致不必要的几何失真。由于内容丢失或失真，识别准确性可能会受到损害。此外，当对象尺度变化时，预定义的尺度 (例如，224) 可能不适合。

那么为什么CNNs需要固定的输入大小呢？CNN主要由两部分组成: 卷积层和随后的全连接层。卷积层以滑动窗口方式操作，并输出表示激活的空间布置的特征图 (图2)。实际上，卷积层不需要固定的图像大小，并且可以生成任何大小的特征图。另一方面，全连接的层需要根据其定义具有固定的大小/长度输入。因此，固定大小的约束仅来自全连接的层，这些层存在于网络的更深层次。