数据集划分 - 训练集、测试集、验证集

数据集划分是炼丹的准备工作。附上一次性划分的步骤。

Step1: 获取所有文件名

ls >a.txt

注意在生成的txt里将其本名删去。
在这里插入图片描述

Step2:按照比例划分
这里使用的是train:test:val = 7:2:1 的比例划分。直接用mod10结果分类。

# clear contents
with open('val.txt', 'a+', encoding='utf-8') as f_val:
    f_val.truncate(0)
f_val.close()

with open('test.txt', 'a+', encoding='utf-8') as f_test:
    f_test.truncate(0)
f_test.close()

with open('train.txt', 'a+', encoding='utf-8') as f_train:
    f_train.truncate(0)
f_train.close()

# read and write
with open("a.txt", encoding='utf-8') as f:
    count = 0
    for line in f.readlines():
        count = count + 1
        # print("NO.", count, ":", line)
        if count % 10 == 1:
            with open('val.txt', 'a') as f_val:
                f_val.write(line)
            f_val.close()
        elif count % 5 == 0:
            with open('test.txt', 'a') as f_test:
                f_test.write(line)
            f_test.close()
        else:
            with open('train.txt', 'a') as f_train:
                f_train.write(line)
            f_train.close()
f.close()

结果:

在这里插入图片描述

  • 0
    点赞
  • 5
    收藏
    觉得还不错? 一键收藏
  • 1
    评论
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值