数据不平衡

13 篇文章 0 订阅
11 篇文章 0 订阅

样本层面

  1. 欠采样和过采样
  • 欠采样:随机删除一些类别多的数据,但是会改变数据分布,减少信息。
    目前比较好的方法是将欠采样应用到集成学习中,即对正例进行多次欠采样,将其分成n份,之后配以反例,从而形成多组正例/反例数据集,供多个学习器使用。这样看来,每个学习器都采用了欠采样,但是在全局看来不会丢失重要信息。
  • 过采样:把类别少的数据通过复制或生成SMOTH的方法变多,也可用数据增强的方法去做。
  1. 数据增强
  • 根据现有数据,合成新数据: 对句子中的单词,短语,句子结构做一些更改,保留原始语义

损失函数层面

  • Focal Loss:惩罚把少样本分错的行为,让模型更多关注少样本,一般只有微小的提升。
  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 打赏
    打赏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

石头猿rock

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值