mxnet复现SSD之数据集的导入

最新推荐文章于 2024-07-24 17:21:03 发布

暮丶凉

最新推荐文章于 2024-07-24 17:21:03 发布

阅读量376

点赞数

分类专栏：深度学习 mxnet

本文链接：https://blog.csdn.net/qq_19457459/article/details/108680448

版权

mxnet复现SSD系列文章目录

一、数据集的导入.
二、SSD模型架构.
三、训练脚本的实现.
四、损失、评价函数.
五、预测结果.

文章目录

mxnet复现SSD系列文章目录
前言
一、pascal VOC
二、导入数据集
- 1. 拆分数据集
- 2.制作用于mxnet中ImageDetIter类读取的rec，lst文件
三、读取rec文件，展示结果
参考链接

前言

本项目是按照pascal voc的格式读取数据集，数据集为kaggle官网提供的口罩检测数据集，地址：Face Mask Detection，模型架构参考自gluoncv ssd_300_vgg16_atrous_voc源码

一、pascal VOC

首先介绍一下pascal voc格式

.
└── VOCdevkit #根目录
└── VOC2012 #不同年份的数据集
├── Annotations #存放xml文件，文件序号与JPEGImages中的图片一一对应
├── ImageSets #该目录下存放的都是txt文件，txt文件中每一行包含一个图片的名称，末尾会加上±1表示正负样本
│ ├── Action
│ ├── Layout
│ ├── Main
│ └── Segmentation
├── JPEGImages #存放源图片
├── SegmentationClass #存放的是图片，语义分割相关
└── SegmentationObject #存放的是图片，实例分割相关

重点看一下Annotations中的文件内容：

> <annotation>
	<folder>VOC2012</folder>	
	<filename>2007_000027.jpg</filename>	// 对应的图片名称
	<source>
		<database>The VOC2007 Database</database>
		<annotation>PASCAL VOC2007</annotation>
		<image>flickr</image>
	</source>
	<size>
		<width>486</width>	// 图片的宽
		<height>500</height>	// 图片的高
		<depth>3</depth>	// 图片通道大小
	</size>
	<segmented>0</segmented>
	<object>
		<name>person</name>		// 图片包含的类别
		<pose>Unspecified</pose>
		<truncated>0</truncated>
		<difficult>0</difficult>	// difficult代表是否难以识别
		<bndbox>					// bndbox的左上角和右下角坐标
			<xmin>174</xmin>	
			<ymin>101</ymin>
			<xmax>349</xmax>
			<ymax>351</ymax>
		</bndbox>
		<part>
			<name>head</name>
			<bndbox>
				<xmin>169</xmin>
				<ymin>104</ymin>
				<xmax>209</xmax>
				<ymax>146</ymax>
			</bndbox>
		</part>
		<part>
			<name>hand</name>
			<bndbox>
				<xmin>278</xmin>
				<ymin>210</ymin>
				<xmax>297</xmax>
				<ymax>233</ymax>
			</bndbox>
		</part>
		<part>
			<name>foot</name>
			<bndbox>
				<xmin>273</xmin>
				<ymin>333</ymin>
				<xmax>297</xmax>
				<ymax>354</ymax>
			</bndbox