亲测可用！Ubuntu 上PAC VOC数据集划分Python代码实现！

最新推荐文章于 2024-04-08 19:51:10 发布

君子当自强不息

最新推荐文章于 2024-04-08 19:51:10 发布

阅读量397

点赞数 3

分类专栏：目标检测文章标签：神经网络深度学习 pytorch 自动驾驶

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/qq_26413875/article/details/106895415

版权

目标检测专栏收录该内容

6 篇文章 0 订阅

订阅专栏

网上关于划分训练集，验证集，测试集的实现已经很多随便搜索下就可以出来很多但是自己亲自用过的才是最有保障的吧特此记录下以免哪天丢失又得费一番功夫也供大家参考下

Python代码实现

#!/usr/bin/env python
# -*- coding:utf-8 -*-
# Author: yehaizi time:2019/10/28:9:24
import os
import random

trainval_percent = 0.8   # trainval占总数的比例
# train_percent = 0.5   # train占trainval的比例
xmlfilepath = "/home/hq/Research/data/VOC/VOCtrainval-2012/VOCdevkit/VOC2012/Annotations/"
txtsavepath = "/home/hq/Research/data/VOC/VOCtrainval-2012/VOCdevkit/VOC2012/ImageSets/Main/"
total_xml = os.listdir(xmlfilepath)    # 列举当前目录下所有的文件，返回的是列表类型

num = len(total_xml)                   # 获得总的文件个数 这里就是xml文件的个数
list = range(num)                        # 生成一个整数列表 如num=10，则为[1,2,3,4,...9]
tv = int(num * trainval_percent)
# tr = int(tv * train_percent)       #我直接将trainval作为训练集 故这里注释掉 你们自己的就看情况
trainval = random.sample(list, tv)    # 多个字符中生成指定数量的随机字符
# train = random.sample(trainval, tr) # 同理 注释掉

ftrainval = open(txtsavepath + 'trainval.txt', 'w')
ftest = open(txtsavepath + 'test.txt', 'w')
# ftrain = open(txtsavepath + r'\train.txt', 'w')
# fval = open(txtsavepath + r'\val.txt', 'w')

for i in list:
    name = total_xml[i][:-4] + '\n'
    if i in trainval:
        ftrainval.write(name)
        # 同理 注释掉
        # if i in train: 
        #     ftrain.write(name)
        # else:
        #     fval.write(name)
    else:
        ftest.write(name)

君子当自强不息

关注

3
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

君子当自强不息 CSDN认证博客专家 CSDN认证企业博客

码龄10年

27: 原创

103万+: 周排名

191万+: 总排名

7万+: 访问

: 等级

1082: 积分

28: 粉丝

91: 获赞

29: 评论

304: 收藏

私信

关注

热门文章

分类专栏

最新评论

通俗易懂，面向对象与面向过程的区别
brawellen: 谢谢博主，写得通俗易懂，茅塞顿开
对目标检测中的正负样本的理解
lmw0320: 我对这个专门弄的无目标的图片，其实也不是很理解。。我个人觉得有些意义不大。除非这种类型的图片测试时发现存在较多误检情况。。因为即使使用了这些纯背景图片，其实也只是相当于模型挑选负样本时，多了些选择而已。。本质上与不使用纯背景图片，其实差别不太大。而且制作标签文件的时候，貌似不太好弄？？
对目标检测中的正负样本的理解
Faster--YOLO: 好的，谢谢解答，我看评论了，觉得评论里还是有些意见不统一，所以想确认下。那也就是说数据集中不需要无目标图片即背景图片吗（但是我看了一篇数据集的论文，他们就专门划分出了无目标图片）另外，我觉得没有目标的图片可以叫做“无目标图片”或“背景图片”，把无目标图片称为“负样本”容易让人误解
对目标检测中的正负样本的理解
lmw0320: 你要看完评论啊。。我说过了，可以不需要完全没有目标的图片。我的个人理解是，负样本，并不是我们人为可以控制的。---从yolo的算法原理来看，其是根据前向传播得到的结果中，自动去划分正负样本的（概率0.7+的视为正样本，概率为0.3-的视为负样本，其余概率的结果抛弃。负样本的概率阈值是0.3还是0.4，我也记得不是很清楚了）。具体可以参看：https://blog.csdn.net/clearch/article/details/80224223 当然，你人为去增加负样本的操作也是有的，就是人为再设定一个类别，专门作为负样本类别。
对目标检测中的正负样本的理解
Faster--YOLO: 2022年了，这个问你题解决了吗我也有这个疑问，负样本（背景图）到底需不需要标注？

最新文章

目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。