机器学习中检验样本抽样的均匀——KL散度检验和K-S检验

最近做的一个项目中,需要对原来的数据进行一定量的采样形成训练集,因此需要保证采样的均匀性以保证样本参数的同分布性。

样本数据是这样的:

ID.wav Date

可以看到,样本数据只有日期参数可以使用,所以我采用对抽样后的样本跟总体的日期参数进行分布检验的方法。


因为日期的分布不具有分布假设,所以需要用非参数检验方法,直接比较两个分布的差异,我找到两种方法:

1.机器学习中常用的KL散度方法

2.社会统计学中常用的K-S检验方法


简单介绍一下这两种方法:

KL散度

在总体分布P的每一个值上进行加权,对于P很大的时候Q也要很大,P很小时Q的大小没关系,以保证Q是P的局部样本

KL(P||Q) = \sum_i P(i) \log \left(P(i) \over Q(i)\right)

直观来说,这是对随机变量的每个取值上,\log(P(i)/Q(i))这个值的加权平均。这里加权的权值是P(i) (其实就是算了个期望)。

  • 0
    点赞
  • 4
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值