DataWhale基础算法梳理-3.决策树

最新推荐文章于 2024-09-15 14:07:50 发布

Xayahion

最新推荐文章于 2024-09-15 14:07:50 发布

阅读量176

点赞数

分类专栏：机器学习文章标签：决策树

本文链接：https://blog.csdn.net/qq_24313621/article/details/86722461

版权

机器学习专栏收录该内容

3 篇文章 0 订阅

订阅专栏

【学习任务】

1. 信息论基础（熵联合熵条件熵信息增益信息增益比基尼不纯度）？

2.决策树的不同分类算法（ID3算法、C4.5、CART分类树）的原理及应用场景？

3. 回归树原理？

4. 决策树防止过拟合手段？

问题答案：

1.信息论基础

熵：信息是很抽象的概念，一直都无法估计信息量，直到1948年，香农提出了“信息熵”的概念，指出了“信息是用来消除随机不确定性的东西”，解决了对信息的量化度量问题。

熵是用来衡量一个系统混论程度的物理量，代表一个系统中蕴含多少信息量，信息量越大表明一个系统不确定性就越大，就存在越多的可能性。

联合熵：

两个随机变量X，Y的联合分布，可以形成联合熵（Joint Entropy），用H(X, Y)表示。即：H(X, Y) = -Σp(x, y) lnp(x, y)

条件熵：H(X|Y)

信息增益：

划分前样本集合D的熵是一定的，entroy(前)，使用某个特征A划分数据集D，计算划分后的数据子集的熵 entroy(后)

信息增益 = entroy(前) - entroy(后)

信息增益比：信息增益比 = 惩罚参数 * 信息增益

基尼不纯度：基尼指数（基尼不纯度）= 样本被选中的概率 * 样本被分错的概率

2.决策树的不同分类算法的原理及应用场景

ID3算法

ID3由Ross Quinlan在1986年提出。ID3决策树可以有多个分支，但是不能处理特征值为连续的情况。决策树是一种贪心算法，每次选取的分割数据的特征都是当前的最佳选择，并不关心是否达到最优。在ID3中，每次根据“最大信息熵增益”选取当前最佳的特征来分割数据，并按照该特征的所有取值来切分，也就是说如果一个特征有4种取值，数据将被切分4份，一旦按某特征切分后，该特征在之后的算法执行中，将不再起作用，所以有观点认为这种切分方式过于迅速。ID3算法十分简单，核心是根据“最大信息熵增益”原则选择划分当前数据集的最好特征，信息熵是信息论里面的概念，是信息的度量方式，不确定度越大或者说越混乱，熵就越大。在建立决策树的过程中，根据特征属性划分数据，使得原本“混乱”的数据的熵(混乱度)减少，按照不同特征划分数据熵减少的程度会不一样。在ID3中选择熵减少程度最大的特征来划分数据（贪心），也就是“最大信息熵增益”原则。下面是计算公式，建议看链接计算信息上增益的实例。

C4.5算法

C4.5是Ross Quinlan在1993年在ID3的基础上改进而提出的。.ID3采用的信息增益度量存在一个缺点，它一般会优先选择有较多属性值的Feature,因为属性值多的Feature会有相对较大的信息增益?(信息增益反映的给定一个条件以后不确定性减少的程度,必然是分得越细的数据集确定性更高,也就是条件熵越小,信息增益越大).为了避免这个不足C4.5中是用信息增益比率(gain ratio)来作为选择分支的准则。信息增益比率通过引入一个被称作分裂信息(Split information)的项来惩罚取值较多的Feature。除此之外，C4.5还弥补了ID3中不能处理特征属性值连续的问题。但是，对连续属性值需要扫描排序，会使C4.5性能下降，有兴趣可以参考博客

Cart树

CART（Classification and Regression tree）分类回归树由L.Breiman,J.Friedman,R.Olshen和C.Stone于1984年提出。ID3中根据属性值分割数据，之后该特征不会再起作用，这种快速切割的方式会影响算法的准确率。CART是一棵二叉树，采用二元切分法，每次把数据切成两份，分别进入左子树、右子树。而且每个非叶子节点都有两个孩子，所以CART的叶子节点比非叶子多1。相比ID3和C4.5，CART应用要多一些，既可以用于分类也可以用于回归。CART分类时，使用基尼指数（Gini）来选择最好的数据分割的特征，gini描述的是纯度，与信息熵的含义相似。CART中每一次迭代都会降低GINI系数。下图显示信息熵增益的一半，Gini指数，分类误差率三种评价指标非常接近。回归时使用均方差作为loss function。基尼系数的计算与信息熵增益的方式非常类似，公式如下