不平衡样本处理
啥也不说了,直接上图!!!
需要注意:
过采样:重复正比例数据,实际上没有为模型引入更多数据,过分强调正比例数据,会放大正比例噪音对模型的影响。
欠采样:丢弃大量数据,和过采样一样会存在过拟合的问题
措施:
- 可以选择调整阈值,使得模型对于较少的类别更为敏感
- 选择合适的评估标准,比如ROC或者F1,而不是准确度(accuracy)
总结:
过采样它不可避免的带来更大的运算开销,其次当数据中噪音过大时,结果反而可能会更差因为噪音也被重复使用。
使用过采样(或SMOTE)+强正则模型(如XGBoost)可能比较适合不平衡的数据。拿到一个新的数据时,可以不妨直接先试试这个方法,作为基准(Baseline)。
一个比较成熟的算法就是用SMOTE过采样,再利用Tomek’s link再控制新的样本空间。
参考博客:https://blog.csdn.net/qq_27802435/article/details/81201357
https://blog.csdn.net/Dawei_01/article/details/80846371
https://www.zhihu.com/question/269698662
官方文档:https://imbalanced-learn.org
这篇存了好久都忘记发了。。。 今天一起补上吧