样本不平衡及处理方法

  在机器学习和数据挖掘领域,数据不平衡问题是我们拿到数据之后优先需要考虑的问题,如果直接对不平衡的数据进行建模,得到的模型往往也是不具备良好的泛化性的。

1 什么是数据不平衡?

  数据不平衡就是指:初始数据的各类别分布不均匀,比如正类负类的比例是99:1。那么对于模型而言,只要它只判定为正,也有99%的正确率。由此就出现了数据不平衡带来的问题。

所以在算法选择之前,优先处理数据不平衡的问题。

2 数据不平衡的解决方法

2.1 采样

  采样通常有两种办法,上采样和下采样

上采样:增大小样本类别的数据量。通过重复、自举、合成等方法增大样本数,使数据分布均衡。
下采样:随机抽取大样本的数据,和小样本数据保持一致。

2.2采用k折交叉验证法

  通过k折交叉验证法,k次结果之后取平均

2.3 采用SVM,决策树算法

  由于SVM采用的是支持向量来确定超平面,和样本数的数量无关,仅仅和支持向量有关,所以样本不平衡对SVM算法不影响其精确度。

  决策树算法可以采用信息增益比作为特征选择的方法,克服了数据不平衡导致的一方信息增益过大的问题。

2.4 使用集成学习

  采用集成学习的框架,对多个分类器进行融合,可以有效的降低了样本不平衡带来的影响。

  • 1
    点赞
  • 4
    收藏
    觉得还不错? 一键收藏
  • 打赏
    打赏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

Weiyaner

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值