自助法及其python实现

本文介绍了自助法(Bootstrapping)的基本原理,它是一种在数据量小或难以划分训练集和测试集时的有效方法。通过有放回地随机采样形成新的数据集,约35%的数据未被抽中用于测试。自助法适用于集成学习,但可能改变数据分布导致估计偏差。此外,还展示了Python实现自助法的过程,显示了数据重复和未被抽取的情况。
摘要由CSDN通过智能技术生成

在对数据集划分训练集和测试集的时候,我们经常采用的有三种方法,其中留出法和交叉验证法已经在上一篇中有所说明。

本文将主要讲述自助法(bootstrapping)及其python实现。

在上一篇中,我们说明当数据量很小时,我们可以使用留一法,但是这种方法会造成计算复杂度过高。此时,我们引入自助法来解决问题。

1.理论说明

自助法: 给定包含m个样本的数据集 D D D,我们对它进行采样产生数据集 D ′ D' D:每次随机从 D D D中挑选一个样本,将其复制到 D ′ D' D中,然后再将其样本放回原始数据集 D D D中,使得该样本在下次采样的时候也可能被采到;这个过程重复执行m次,我们就得到了包含m个样本的数据集 D ′ D' D。简而言

评论 6
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值