过采样和欠采样问题（二分类数据不均衡）

最新推荐文章于 2024-07-11 16:39:03 发布

ICUD

最新推荐文章于 2024-07-11 16:39:03 发布

阅读量4.3k

点赞数 2

原文链接：https://blog.csdn.net/Dawei_01/article/details/80846371?depth_1-utm_source=distribute.pc_relevant.none-task-blog-BlogCommendFromBaidu-1&utm_source=distribute.pc_relevant.none-task-blog-BlogCommendFromBaidu-1

版权

参考：知乎专栏

项目中出现了二分类数据不平衡问题，研究总结下对于类别不平横问题的处理经验：

1：为什么类别不平衡会影响模型的输出：

许多模型的输出类别是基于阈值的，例如逻辑回归中小于0.5的为反例，大于则为正例。在数据不平衡时，默认的阈值会导致模型输出倾向与类别数据多的类别。

因此可以在实际应用中，解决办法包括：

1)调整分类阈值，使得更倾向与类别少的数据。

2）选择合适的评估标准，比如ROC或者F1，而不是准确度（accuracy）

3）过采样法（sampling）：来处理不平横的问题。分为欠采样(undersampling)和过采样(oversampling)两种，

过采样：重复正比例数据，实际上没有为模型引入更多数据，过分强调正比例数据，会放大正比例噪音对模型的影响。

欠采样：丢弃大量数据，和过采样一样会存在过拟合的问题。

由于随机过采样采取简单复制样本的策略来增加少数类样本，这样容易产生模型过拟合的问题，即使得模型学习到的信息过于特别(Specific)而不够泛化(General)

4）数据合成：SMOTE（Synthetic Minority Oversampling Technique）即合成少数类过采样技术，它是基于随机过采样算法的一种改进方案，，SMOTE算法的基本思想是对少数类样本进行分析并根据少数类样本人工合成新样本添加到数据集中。

经验：

PS：（评估指标不能解决根本问题，必须把样本平衡才可能有效）

关注

2
点赞
踩
7

收藏

觉得还不错? 一键收藏
0
评论
过采样和欠采样问题（二分类数据不均衡）

参考：知乎专栏项目中出现了二分类数据不平衡问题，研究总结下对于类别不平横问题的处理经验：1：为什么类别不平衡会影响模型的输出：许多模型的输出类别是基于阈值的，例如逻辑回归中小于0.5的为反例，大于则为正例。在数据不平衡时，默认的阈值会导致模型输出倾向与类别数据多的类别。因此可以在实际应用中，解决办法包...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。