决策树模型原理及实践

大王替我来巡山

于 2020-08-22 20:54:38 发布

阅读量1.2k

点赞数

文章标签：决策树可视化大数据数据挖掘 python

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_45319287/article/details/108174128

版权

本文深入探讨了决策树模型的原理，包括介绍、构建算法、划分选择的标准（信息增益与基尼指数）。此外，文章还介绍了在Python中实现决策树的关键参数，如criterion、random_state和max_depth等，并通过实际案例展示了决策树的训练、数据可视化和预测过程，以企鹅数据集为例，展示了模型在二分类和三分类任务上的应用。

摘要由CSDN通过智能技术生成

决策树模型

1、决策树原理及介绍

1.1 决策树介绍

决策树是一种常见的分类模型，在金融分控、医疗辅助诊断等诸多行业具有较为广泛的应用。决策树的核心思想是基于树结构对数据进行划分，这种思想是人类处理问题时的本能方法。例如在婚恋市场中，女方通常会先看男方是否有房产，如果有房产再看是否有车产，如果有车产再看是否有稳定工作……最后得出是否要深入了解的判断。

决策树的主要优点：

具有很好的解释性，模型可以生成可以理解的规则。
可以发现特征的重要程度。
模型的计算复杂度较低。

决策树的主要缺点：

模型容易过拟合，需要采用减枝技术处理。
不能很好利用连续型特征。
预测能力有限，无法达到其他强监督模型效果。
方差较高，数据分布的轻微改变很容易造成树结构完全不同。

1.2 决策树构建算法

决策树的构建过程是一个递归过程。函数存在三种返回状态：

（1）当前节点包含的样本全部属于同一类别，无需继续划分；

（2）当前属性集为空或者所有样本在某个属性上的取值相同，无法继续划分；

（3）当前节点包含的样本集合为空，无法划分。

其构建算法如下：

输入：训练集D= $\left\{\left(x_{1}, y_{1}\right),\left(x_{2}, y_{2}\right) \ldots \ldots,\left(x_{m}, y_{m}\right)\right\}$

特征集A= $\left(a_{1}, a_{2}, \ldots ., a_{d}\right)$

输出：以node为根节点的一颗决策树

过程：函数TreeGenerate $(D, A)$

生成节点node
if $D$ 中样本全部属于同一类别 $C$ then:
---- 将node标记为 $C$ 类叶节点：return
if $A =$ 空集 or D中样本在 $A$ 上的取值相同 then:
---- 将node标记为叶节点，其类别标记为 $D$ 中样本数最多的类; return
从 A 中选择最优划分属性 $a_{*}$
for $a··C 0 C^{v}$ do:
----为node生成一个分支, 令 $D_{v}$ 表示 $D$ 中在 $a··C 1 C^{v}$ 的样本子集;
----if $D_{v}$ 为空 then:
--------将分支节点标记为叶节点，其类别标记为 D 中样本最多的类; then
----else:
--------以 TreeGenerate $\left(D_{v}, A\left\{a_{*}\right\}\right)$ 为分支节点

1.3 划分选择

从上述伪代码中我们发现，决策树的关键在于line6.从A中选择最优划分属性 $a_{*}$ ，一般我们希望决策树每次划分节点中包含的样本尽量属于同一类别，也就是节点的“纯度”更高。

1.3.1 信息增益

信息熵是一种衡量数据混乱程度的指标，信息熵越小，则数据的“纯度”越高
$\operatorname{Ent}(D)=-\sum_{k=1}^{|y|} p_{k} \log _{2} p_{k}$
其中 $p_{k}$ 代表了第k类样本在D中占有的比例。

假设离散属性 $a$ 有 $V$ 个可能的取值 $\left\{a^{1}, a^{2}, \ldots ., a^{V}\right\},$

最低0.47元/天解锁文章

大王替我来巡山

关注

0
点赞
踩
5

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。