python按比例生成数据组_python按比例随机切分数据的实现

最新推荐文章于 2023-02-13 09:06:23 发布

weixin_39992462

最新推荐文章于 2023-02-13 09:06:23 发布

阅读量405

点赞数

文章标签： python按比例生成数据组

在机器学习或者深度学习中，我们常常碰到一个问题是数据集的切分。比如在一个比赛中，举办方给我们的只是一个带标注的训练集和不带标注的测试集。其中训练集是用于训练，而测试集用于已训练模型上跑出一个结果，然后提交，然后举办方验证结果给出一个分数。但是我们在训练过程中，可能会出现过拟合等问题，会面临着算法和模型的选择，此时，验证集就显得很重要。通常，如果数据量充足，我们会从训练集中划分出一定比例的数据来作为验证集。

每次划分数据集都手动写一个脚本，重复性太高，因此将此简单的脚本放到自己的博客。代码如下：

import random

def split(full_list,shuffle=False,ratio=0.2):

n_total = len(full_list)

offset = int(n_total * ratio)

if n_total==0 or offset<1:

return [],full_list

if shuffle:

random.shuffle(full_list)

sublist_1 = full_list[:offset]

sublist_2 = full_list[offset:]

return sublist_1,sublist_2

if __name__ == "__main__":

li = range(5)

sublist_1,sublist_2 = split(li,shuffle=True,ratio=0.2)

print sublist_1,len(sublist_1)

print sublist_2,len(sublist_2)

其中，main为测试代码。假如训练集给出的是一个文件，我们先将文件读到列表中，然后再调用split。

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持脚本之家。

weixin_39992462

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
python按比例生成数据组_python按比例随机切分数据的实现

在机器学习或者深度学习中，我们常常碰到一个问题是数据集的切分。比如在一个比赛中，举办方给我们的只是一个带标注的训练集和不带标注的测试集。其中训练集是用于训练，而测试集用于已训练模型上跑出一个结果，然后提交，然后举办方验证结果给出一个分数。但是我们在训练过程中，可能会出现过拟合等问题，会面临着算法和模型的选择，此时，验证集就显得很重要。通常，如果数据量充足，我们会从训练集中划分出一定比例的数据来作为...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。