[DataAnalysis]点互信息

参考:https://www.jianshu.com/p/79de56cbb2c7

点互信息(pointwise mutual information)用于衡量两个事物之间的相关性,比如两个词。公式如下:

pmi(x;y)=log\frac{p(x,y)}{p(x)p(y)}=log\frac{p(x|y)}{p(x)}=log\frac{p(y|x)}{p(y)}

这里的log来源于信息论,可以简单地理解为当对p(x)log之后就将一个概率转换为信息量,以2为底时可以简单理解为用多少个bits可以表示这个变量。

例子

我们想衡量like这个词的情感。我们可以预先挑选一些正向情感的词,比如good。然后计算like和good的PMI。

PMI(like,good)=log\frac{p(like,good)}{p(like)p(good)}

PMI(like,good)越大则表示like的正向情感倾向就越明显。

互信息

I(X;Y)=\sum _{x\in X}\sum _{y\in Y}p(x,y)log\frac{p(x,y)}{p(x)p(y)}

衡量的是两个随机变量的相关性,即一个随机变量中包含另一个随机变量的信息量。

可以看出,互信息其实就是对X和Y的所有可能取值的点互信息的加权和。

  • 0
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值