机器学习：不均衡样本情况下的抽样

最新推荐文章于 2023-03-02 10:31:46 发布

_Yucen

最新推荐文章于 2023-03-02 10:31:46 发布

阅读量2k

点赞数 2

分类专栏： ML&DM 机器学习笔记

ML&DM 同时被 2 个专栏收录

17 篇文章 0 订阅

订阅专栏

机器学习笔记

15 篇文章 5 订阅

订阅专栏

题目

在分类问题中,我们经常会遇到正负样本数据量不等的情况,比如正样本为10w条数据,负样本只有1w条数据,以下最合适的处理方法是( )（多选）

A. 将负样本重复10次,生成10w样本量,打乱顺序参与分类

B. 直接进行分类,可以最大限度利用数据

C. 从10w正样本中随机抽取1w参与分类

D. 将负样本每个权重设置为10,正样本权重为1,参与训练过程

---------------------------------------------------------------------------------

解析

答案：ACD

解决这类问题主要分重采样、欠采样、调整权值

1. 重采样

A可视作重采样的变形。改变数据分布消除不平衡，可能导致过拟合。

2. 欠采样

C的方案提高少数类的分类性能，可能丢失多数类的重要信息。

如果1：10算是均匀的话，可以将多数类分割成为1000份。然后将每一份跟少数类的样本组合进行训练得到分类器。而后将这1000个分类器用assemble的方法组合位一个分类器。

另：如果目标是预测的分布跟训练的分布一致，那就加大对分布不一致的惩罚系数。

3. 权值调整

D方案也是其中一种方式。

---------------------
转自：https://blog.csdn.net/ztf312/article/details/50893967

关注

2
点赞
踩
2

收藏

觉得还不错? 一键收藏
0
评论
机器学习：不均衡样本情况下的抽样

题目在分类问题中,我们经常会遇到正负样本数据量不等的情况,比如正样本为10w条数据,负样本只有1w条数据,以下最合适的处理方法是( )（多选）A. 将负样本重复10次,生成10w样本量,打乱顺序参与分类B. 直接进行分类,可以最大限度利用数据C. 从10w正样本中随机抽取1w参与分类D. 将负样本每个权重设置为10,正样本权重为1,参与训练过程---------------...
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。