本文结构:
- 是什么?
- 有什么算法?
- 数学原理?
- 编码实现算法?
1. 是什么?
简单地理解,就是根据一些 feature 进行分类,每个节点提一个问题,通过判断,将数据分为几类,再继续提问。这些问题是根据已有数据学习出来的,再投入新数据的时候,就可以根据这棵树上的问题,将数据划分到合适的叶子上。
2. 有什么算法?
常用的几种决策树算法有ID3、C4.5、CART:
ID3:选择信息熵增益最大的feature作为node,实现对数据的归纳分类。
C4.5:是ID3的一个改进,比ID3准确率高且快,可以处理连续值和有缺失值的feature。
CART:使用基尼指数的划分准则,通过在每个步骤最大限度降低不纯洁度,CART能够处理孤立点以及能够对空缺值进行处理。
3. 数学原理?
ID3: Iterative Dichotomiser 3
下面这个数据集,可以同时被上面两颗树表示,结果是一样的,而我们更倾向于选择简单的树。
那么怎样做才能使得学习到的树是最简单的呢?
下面是 ID3( Iterative Dichotomiser 3 )的算法:
例如下面数据集,哪个是最好的 Attribute?
用熵Entropy来衡量:
E(S) 是数据集S的熵
i 指每个结果,即 No,Yes的概率
E越大意味着信息越混乱,我们的目标是要让E最小。
E在0-1之间,如果P+的概率在0.5, 此时E最大,这时候说明信息对我们没有明确的意义,对分类没有帮助。
但是我们不仅仅想要变量的E最小,还想要这棵树是 well organized。
所以用到 Gain:信息增益
意思是如果我后面要用这个变量的话,它的E会减少多少。
例如下面的数据集:
先计算四个feature的熵E,及其分支的熵,然后用Gain的公式计算信息增益。
再选择Gain最大的特征是 outlook。
第一层选择