决策树的python实现

最新推荐文章于 2024-09-29 08:42:56 发布

Alice熹爱学习

最新推荐文章于 2024-09-29 08:42:56 发布

阅读量5.1k

点赞数

分类专栏： MachineLearning 机器学习

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/aliceyangxi1987/article/details/71079490

版权

本文详细介绍了决策树的基础知识，包括ID3和C4.5算法的原理和实现。ID3基于信息熵增益选择特征，C4.5则通过信息增益率处理连续值和缺失值。文章通过实例解释了如何计算信息熵和信息增益，并展示了C4.5算法处理连续值和缺失值的方法。最后，提到了决策树的编码实现。

摘要由CSDN通过智能技术生成

本文结构：

是什么？
有什么算法？
数学原理？
编码实现算法？

1. 是什么？

简单地理解，就是根据一些 feature 进行分类，每个节点提一个问题，通过判断，将数据分为几类，再继续提问。这些问题是根据已有数据学习出来的，再投入新数据的时候，就可以根据这棵树上的问题，将数据划分到合适的叶子上。

2. 有什么算法？

常用的几种决策树算法有ID3、C4.5、CART：

ID3：选择信息熵增益最大的feature作为node，实现对数据的归纳分类。
C4.5：是ID3的一个改进，比ID3准确率高且快，可以处理连续值和有缺失值的feature。
CART：使用基尼指数的划分准则，通过在每个步骤最大限度降低不纯洁度，CART能够处理孤立点以及能够对空缺值进行处理。

3. 数学原理？

ID3: Iterative Dichotomiser 3

下面这个数据集，可以同时被上面两颗树表示，结果是一样的，而我们更倾向于选择简单的树。
那么怎样做才能使得学习到的树是最简单的呢？

下面是 ID3（ Iterative Dichotomiser 3 ）的算法：

例如下面数据集，哪个是最好的 Attribute？

用熵Entropy来衡量：
E(S) 是数据集S的熵
i 指每个结果，即 No，Yes的概率

E越大意味着信息越混乱，我们的目标是要让E最小。
E在0-1之间，如果P＋的概率在0.5，此时E最大，这时候说明信息对我们没有明确的意义，对分类没有帮助。

但是我们不仅仅想要变量的E最小，还想要这棵树是 well organized。
所以用到 Gain：信息增益

意思是如果我后面要用这个变量的话，它的E会减少多少。

例如下面的数据集：

先计算四个feature的熵E，及其分支的熵，然后用Gain的公式计算信息增益。
再选择Gain最大的特征是 outlook。
第一层选择

最低0.47元/天解锁文章

评论 2

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。