Faster RCNN基本结构和各部分原理详解

ViperL1

已于 2023-03-07 10:51:55 修改

阅读量3.2k

点赞数

分类专栏：神经网络学习笔记文章标签：目标检测人工智能计算机视觉

于 2022-11-10 18:18:22 首次发布

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_37878740/article/details/127792590

版权

学习笔记同时被 2 个专栏收录

155 篇文章 12 订阅

订阅专栏

72 篇文章 16 订阅

订阅专栏

一、网络总体结构

总体结构如图：

可分为以下四个模块↓

名称	作用
卷积层(conv)	提取feature maps
区域候选网络(RPN)	分类：对预设的anchor进行二分类 Bounding box regression-修正较为准确的proposals
兴趣域池化(RoI Pooling)	收集PRN生成的proposals，并从feature maps中抠出对应的位置
分类和回归(Classification & Regression)	利用proposals feature maps计算具体类别，在使用bounding box regression获得检测框的精确位置

二、分层详解

①卷积层

卷积层可以基于VGG或ResNet50，本文基于ResNet50构造卷积层。

卷积层合计13个Conv，13个ReLu，4个Pooling。

其中Conv的属性为：kernel_size=3, padding=1, stride=1

Pooling的属性为：kernel_size=2, padding=0, stride=2

Tips：卷积&池化公式

其被组织成两个模组：Conv Block和Identity Block

这两个模块的区别是:Conv Block的残差边有卷积，而Identity Block的残差边上没有卷积。拥有卷积边的Conv Block可以通过改变残差边来改变输出维度，而Identity Block的输入和输出维度是一致的。

其中使用Conv Block的会将图片的长宽/2（步长=2）

使用Identity Block的不会改变图片尺寸

作用：Conv Block用于改变网络维度，Identity Block用于串联以及加深网络深度。

一张MxN的图像经过卷积层后生成的feature map 为(M/16)x(N/16)

②RPN

分为两个部分，

上面的线路通过softmax分类anchors获得正负两类(positive&negtive)

下面的线路通过reg layer计算anchors的bounding box regression偏移量获取proposal

两者在Proposal层汇合，本层负责将positive anchors和对应bounding box regression偏移量获取修正后的proposals（会剔除过小/超出边界的proposals）

其实执行到此处相当于完成了目标定位

②-1Cls layer-anchors

PRN的输入feature map为(M/16)x(N/16)，在其上对每个像素点设置n个anchor（原作为9个）。这些anchor按照一定长宽比设置大小（原作为ratio[1:1，1:2，2:1]）。

原图上的anchor的数量为(M/16)x(N/16)xn。但大部分会淘汰；此通道数为18=2x9->9对应着每个像素点上的九个先验框，2用于判断先验框是否包含物体。

②-3：reg layer

(M/16)x(N/16)x256的features通过一个1x1的kernel输出一组(M/16)x(N/16)x4k，为每个anchor的偏移量(此处输出的仅为偏移量，需要和原坐标进行叠加)，通道数为9x2x4，4为先验框对于建议框的调整量。

4k是应为其偏移量有四个通道，如下

[tx,ty,tw,th]，[xa,ya,wa,ha]为anchor的中心坐标和宽高，其计算公式如下

经过修正(p为原始坐标，d为PRN预测的坐标)，anchor的坐标为

)

②-4：Proposal

合计共三个输入

Cls生成的(M/16)x(N/16)x2k的向量

Reg生成的(M/16)x(N/16)x2k的向量

Im_info=[M,N,scale_factor]

其作用如下：

（1）利用reg层的偏移量，对所有的原始anchor进行修正

（2）利用cls层的scores，按positive socres由大到小排列所有anchors，取前topN（比如6000个）个anchors

（3）边界处理，把超出图像边界的positive anchor超出的部分收拢到图像边界处，防止后续RoI pooling时proposals超出边界。

（4）剔除尺寸非常小的positive anchor

（5）对剩余的positive anchors进行NMS（非极大抑制）

（6）最后输出一堆proposals左上角和右下角坐标值（[x1,y1,x2,y2]对应原图MxN尺度）

③RoI pooling

全连接层输入的feature尺寸必须相同，传统的做法一般是裁剪(crop)或

缩放(wrap)，虽然可以resize图像，但是会出现信息缺失/破坏原始形状信息的问题。

RoI pooling的原理：

将每个proposal对应的feature map区域分为pooled_w x pooled_h的网格

对每个部分做max pooling，使每个proposal输出都是pooled_w x pooled_h

④Classification

其与RPN的区别是RPN仅进行二分类（目标/背景），而classification还需要确定具体属于哪一类。

其主要功能有：

①通过全连接层和softmax对proposals进行分类(多分类)

②在此对proposals进行bunding box regression，获取更高精度的box

关注

0
点赞
踩
34

收藏

觉得还不错? 一键收藏
0
评论
Faster RCNN基本结构和各部分原理详解

Faster RCNN的基本结构
复制链接

扫一扫

专栏目录

ViperL1 CSDN认证博客专家 CSDN认证企业博客

码龄7年

245: 原创

17万+: 周排名

1万+: 总排名

35万+: 访问

: 等级

3317: 积分

1077: 粉丝

435: 获赞

123: 评论

1929: 收藏

私信

关注

热门文章

分类专栏

最新评论

[图神经网络]ViG(Vision GNN)网络代码实现
Jiaqi Lee: 是这样的，可视化结果之后，边缘都不清晰，比较模糊
[图神经网络]ViG(Vision GNN)网络代码实现
ViperL1: 我考虑应该还是和卷积方式有关系，分割的结果基本都呈现弧边，有点像从一点发散出去一样的
[图神经网络]ViG(Vision GNN)网络代码实现
Jiaqi Lee: 作者您好，我将VIG加入新的cv模型中，分类精度有所提升，但是确实分割精度降低了。请问解决这样的问题一般从什么方向考虑？
神经网络（四）前馈神经网络
qq_51507745: 本神经元输入 = 上一层的输入向量 X 权重矩阵 + 偏置应该是上一层的输出向量吧
[卷积神经网络]YoloV9
晨钟•暮鼓: 从理论上来说，SPPELAN相比于SPPF的优点在什么地方啊？

最新文章

目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。