gini系数决策树_终于，这篇文章把决策树的原理讲明白了：熵、信息增益、基尼系数…（深度长文）...

最新推荐文章于 2024-02-19 23:29:24 发布

VIP文章 weixin_39846289

最新推荐文章于 2024-02-19 23:29:24 发布

阅读量2.7k

点赞数 2

文章标签： gini系数决策树

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_39846289/article/details/111664961

版权

决策树由一个根节点、若干个内部节点和叶节点构成，其中，叶节点对应决策结果，其他节点(根节点、内部节点)对应属性判断规则。决策树本质上是一层一层地根据条件递归做判断。

决策树既可以应用于分类任务，也可用于回归任务，具体是用于分类任务还是回归任务，主要取决于目标变量的连续性。如果目标变量为离散变量，则为分类；如果目标变量为连续变量，则为回归。

由于对应决策过程易于可视化、可同时应用于分类和回归任务、可处理大规模数据集等优点，决策树至今仍是监督式学习中应用最广泛的模型之一。

决策树究竟是如何做判断的呢？

案例

已知100个人的身高、体重，并且知道其中有60名男性、40名女性。先需要根据词数据集构造决策树，用于仅根据身高和体重两个属性判断是每个人的性别。

根据男女身高和体重的额差异，可能会问这个人的身高是否超过170cm或者体重是否超过60kg。根据上述过程，可以绘制如下图所示的决策树。其中，图1先根据身高判断，图2先根据体重判断。

以上两种判断过程，哪一种更合理呢？也就是按什么样的特征顺序进行划分，才能找到最纯净的划分(叶节点)？这就是决策树原理中最重要的一个方面：特征属性的重要性，即找出最能区别样本数据集的属性，作为优先判断条件，从而提高决策树的纯度。

01

树的纯度与特征属性重要性

目前，用于衡量树的纯度的方法有三种，纯度的的相反面是不纯度，不纯度越低，即纯度越高。下面是衡量决策树(不)纯度的三种算法。

(1) ID3算法：使用信息增益作为分裂规则

最低0.47元/天解锁文章

weixin_39846289

关注

2
点赞
踩
13

收藏

觉得还不错? 一键收藏
0
评论
gini系数决策树_终于，这篇文章把决策树的原理讲明白了：熵、信息增益、基尼系数…（深度长文）...

决策树由一个根节点、若干个内部节点和叶节点构成，其中，叶节点对应决策结果，其他节点(根节点、内部节点)对应属性判断规则。决策树本质上是一层一层地根据条件递归做判断。决策树既可以应用于分类任务，也可用于回归任务，具体是用于分类任务还是回归任务，主要取决于目标变量的连续性。如果目标变量为离散变量，则为分类；如果目标变量为连续变量，则为回归。由于对应决策过程易于可视化、可同时应用于分类和回归任...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。