机器学习理论——决策树ID3和C4.5

(1)决策树ID3算法的信息论基础

熵在物理学中是度量分子运动的不确定性,分子运动不确定性越大熵越大。而在信息论中,熵度量事件的不确定性,越不确定的事件,熵越大。

离散随机变量X的熵: H ( X ) = − ∑ i = 1 n p i l o g p i H(X)=-\displaystyle\sum_{i=1}^{n}p_ilogp_i H(X)=i=1npilogpi,其中n是离散随机变量的n种不同离散值, p i p_i pi是X取值为i时的概率,log时以2或者e为底的对数。

两个变量X和Y的联合熵: H ( X , Y ) = − ∑ i = 1 n p ( x i , y i ) l o g p ( x i , y i ) H(X,Y)=-\displaystyle\sum_{i=1}^{n}p(x_i,y_i)logp(x_i,y_i) H(X,Y)=i=1np(xi,yi)logp(xi,yi)
两个变量X和Y的条件熵: H ( X ∣ Y ) = − ∑ i = 1 n p ( x i , y i ) l o g p ( x i ∣ y i ) = ∑ j = 1 n p ( y j ) H ( X ∣ y j ) H(X|Y)=-\displaystyle\sum_{i=1}^{n}p(x_i,y_i)logp(x_i|y_i)=\displaystyle\sum_{j=1}^{n}p(y_j)H(X|y_j) H(XY)=i=1np(xi,yi)logp(xiyi)=j=1np(yj)H(Xyj)
互信息: I ( X , Y ) = H ( X ) − H ( X ∣ Y ) I(X,Y)=H(X)-H(X|Y) I(X,Y)=H(X)H(XY),意义是在确定变量Y的条件下,变量X不确定性减少的程度。
互信息在ID3中称为信息增益,可用来判断当前节点应用什么特征构建决策树,信息增益越大越适合分类。
在这里插入图片描述
知识补充点
信息论中条件熵H(X|Y)的定义是Y给定条件下,X条件概率分布的熵对Y的数学期望,即
H ( X ∣ Y ) = p ( Y = y i ) H ( X ∣ Y = y i ) = ∑ y i ∈ Y p ( y i ) H (

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值