交叉熵的理解

本文深入浅出地介绍了信息熵的概念,强调了信息量与事件发生概率的关系,并通过实例解释了相对熵(KL散度)如何衡量分布差异。接着,文章阐述了交叉熵的由来,指出在预测任务中,交叉熵作为相对熵的简化形式,能够有效评估模型预测的准确性。最后,提到交叉熵的非对称性质。
摘要由CSDN通过智能技术生成

晚上看论文,本来在查表示定理相关的内容,结果莫名其妙地绕到了交叉熵上面来了,之前一直对这个概念一知半解的,看了一些知乎上的讲解,然后做个总结。

信息熵

在讲交叉熵之前先讲一下信息熵,信息熵的公式如下:
H ( X ) = − ∑ i = 1 n p ( x i ) l o g p ( x i ) H(X)=-\sum_{i=1}^{n}p(x_{i})log p(x_{i}) H(X)=i=1np(xi)logp(xi)
可以把 − l o g p ( x i ) -log p(x_{i}) logp(xi)看做事件 x i x_{i} xi所携带信息量。一般来说发生概率越小的事件携带的信息量越大,比如别人一脸激动地告诉你冬天会下雪,你会口吐芬芳:“****,这不是废话吗”,因为这句话没什么信息量,冬天下雪的概率太大了;但如果别人一脸激动地告诉你六月飞雪了,你会口吐芬芳:“**,我就说了食堂的菜太难吃了,这下老天都看不下去了”,同样是口吐芬芳(本人最近脾气有点暴躁),但相较于上次的不屑,这次更多的是震惊,毕竟六月飞雪的概率太低了;这个例子主要想解释一下为什么信息量这个表示中前面有个负号。回看信息熵的公式,我们会发现信息熵实际上讲的是某件事携带信息量的期望,我们仍以天气为例,假设明天晴天的概率是 p 1 p_{1} p1,阴天的概率是 p 2 p_{2} p

  • 0
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值