Faster RCNN 模型训练及检测

本文针对faster rcnn下的模型训练及检测。所用网络VGG16/faster_rcnn_alt_opt, 数据集pascal voc2007 .
(友情提示:若要修改某文件里的信息,最好将原文件重命名备份,以免修改后出现问题导致无法复原。)

一 更改类别(选做)
1 打开主目录(YOURS/Downloads/py-faster-rcnn,下同)下 models/pascal_voc/VGG16/faster_rcnn_alt_opt 文件夹里的若干文件,更改类别数。详细步骤可参考http://blog.csdn.net/u013078356/article/details/50987845#reply

2 打开 lib/datasets/pascal_voc.py, 修改self._classes 中的标签信息。此标签名称应与样本.xml文件中的标签名称一致。


二 准备数据集(选做)
1 在 data/VOCdevkit2007/VOC2007 文件夹中,将原有的文件重命名用以备份。然后将含有样本标记信息的.xml文件放入新建的Annotations文件夹,将含有trainval和test样本名称(仅名称,不带后缀)的trainval.txt和test.txt文件放入新建的ImageSets/Main文件夹,将所有的图片放入新建的JPEGImages文件夹。

2 以上3个文件夹的样本信息必须对应,例如.txt文件里的样本应能在其他两个文件夹中找到对应的.xml文件及图片。

3 总样本数量越多越好,trainval 和 test 的样本比例和谐即可。
 

三 执行训练
1 删除 data/cache 文件夹中的.pkl缓存文件。

2 在 data/faster_rcnn_models 文件夹下准备预训练模型。一般直接用作者论文中的模型 VGG16_faster_rcnn_final.caffemodel(10月4 2015)。当然也可以用之前自己训练过的效果较好的模型。

3 修改 tools 文件夹中的 train_faster_rcnn_alt_opt.py .一般只更改迭代次数 max_iters .

4 运行训练。在主目录下打开终端,将 train_faster_rcnn_alt_opt.py 中说明部分runCommand下的一段运行命令复制到终端并按Enter执行训练。运行命令中的--weights模型名称应与三2中准备的模型名称一致。


四 保存模型
1 等待至训练完成,模型保存于 output/faster_rcnn_alt_opt/voc_2007_trainval 文件夹中,其中VGG16_faster_rcnn_final.caffemodel 即为本次训练的最终模型。

2 将 voc_2007_trainval 文件夹重命名,以避免下次训练结果将其覆盖。


五 执行检测
1 将四1中生成的VGG16_faster_rcnn_final.caffemodel 模型重命名(后缀不变)后,复制到data/faster_rcnn_models 文件夹下,用以检测调用。

2 在 data 文件夹中新建 demo_XXXX 文件夹,并放入待检测的图片。

3 在 tools 文件夹中复制一个demo.py文件并重命名为例如 demo_XXXX.py等。

4 打开 demo_XXXX.py文件,修改 CLASSES 中的类别标签,此标签应与样本.xml文件中的标签一致。
修改 NETS 中VGG16下的检测模型,此模型名称应与1中准备的模型名称一致!
修改 NETS 中VGG16下的检测模型,此模型名称应与1中准备的模型名称一致!
修改 NETS 中VGG16下的检测模型,此模型名称应与1中准备的模型名称一致!
修改 im_file 中的存放待检测图片的文件夹名称:demo_XXXX.
修改 im_names 中的待检测图片名称。

5 运行检测。在主目录下打开终端,运行命令 “ tools/demo_XXXX.py --gpu 0 --net vgg16 ”并按Enter执行检测。


友情提示:若有执行训练或检测的历史,部分步骤可以省略。记得对历史文件(夹)的重命名以免结果被覆盖。
### 回答1: 我可以给你介绍一下FasterRCNN模型的文字检测,它是一种基于深度学习的文字检测方法,可以有效的检测和识别文字内容。它的检测原理是利用卷积神经网络(CNN)提取图像特征,然后使用Region Proposal Network(RPN)提取候选文本区域,再通过文本分类和文本定位,最后得到文本检测结果。 ### 回答2: Faster R-CNN是一种常用于图像目标检测模型,它通过整合了快速区域提议网络(RPN)和区域分类网络实现目标的检测。在Faster R-CNN模型中,文字检测也可以通过相似的方法完成。 在文字检测中,首先通过RPN网络生成一系列候选文本区域。RPN网络通过滑动窗口在图像上进行扫描,并使用锚点框来提出候选文本区域的概率分布。 接下来,将RPN网络提出的候选文本区域输入给区域分类网络。区域分类网络通过对这些候选区域进行分类和回归,进一步筛选和修正候选文本区域的位置和形状。 在区域分类网络中,一些常用的特征提取和分类网络如卷积神经网络(CNN)被使用。这些网络能够提取图像的特征,并通过分类器来对候选文本区域进行分类,以确保所选的区域包含文本。 最后,通过将候选文本区域进行后处理,去除重叠的区域,得到最终的文字检测结果。 与传统的文字检测方法相比,Faster R-CNN模型能够更准确地定位和识别文字,同时具有较快的检测速度。通过使用深度学习方法,Faster R-CNN模型能够从大量的图像数据中学习并提取到有效的特征,从而提高了文字检测的准确性和鲁棒性。并且,Faster R-CNN模型还可以通过调整网络结构或训练参数来应对不同场景下的文字检测任务。 ### 回答3: fasterRCNN模型是一种用于文字检测的深度学习模型。它是在传统RCNN(Region Convolutional Neural Networks)模型基础上进行了改进的一种方法。 fasterRCNN模型主要包含两个步骤:区域提议和特征提取。首先,通过使用Selective Search等算法,从输入图像中生成一系列可能包含文字的候选区域。然后,利用卷积神经网络(CNN)从这些候选区域中提取特征。 在特征提取的过程中,fasterRCNN模型采用了一个称为RPN(Region Proposal Network)的子网络。RPN网络通过在不同尺度和长宽比的锚框上应用卷积操作,来预测候选区域中是否包含文字。这样,模型可以根据网络输出的置信度,筛选出可能包含文字的候选区域。 接下来,将被筛选出来的候选区域送入卷积网络继续提取特征。最后,模型通过全连接层和softmax回归层来对这些候选区域进行分类,确定文字区域的位置和类别。 相比于传统的RCNN模型fasterRCNN模型通过引入RPN网络,将候选区域的生成和特征提取结合在了一起,实现了端到端的训练,极大地提高了检测速度。此外,fasterRCNN模型还采用了共享卷积操作,减少了计算量,进一步加快了检测过程。 总的来说,fasterRCNN模型通过提出RPN网络和共享卷积操作,实现了快速准确地检测文字区域的功能。它在文字检测任务中得到了广泛应用,并取得了很好的效果。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值