决策树分类代码python_python编写分类决策树的代码

最新推荐文章于 2024-07-11 09:58:56 发布

极萨学院冷哲

最新推荐文章于 2024-07-11 09:58:56 发布

阅读量329

点赞数

文章标签：决策树分类代码python

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_28896255/article/details/112033923

版权

本文介绍了如何使用Python实现决策树分类，包括信息增益、数据集划分、选择最佳划分特征、递归创建决策树以及分类算法。通过示例代码详细展示了从创建数据集到构建并测试决策树的过程。

摘要由CSDN通过智能技术生成

决策树通常在机器学习中用于分类。

优点：计算复杂度不高，输出结果易于理解，对中间值缺失不敏感，可以处理不相关特征数据。

缺点：可能会产生过度匹配问题。

适用数据类型：数值型和标称型。

1.信息增益

划分数据集的目的是：将无序的数据变得更加有序。组织杂乱无章数据的一种方法就是使用信息论度量信息。通常采用信息增益，信息增益是指数据划分前后信息熵的减少值。信息越无序信息熵越大，获得信息增益最高的特征就是最好的选择。

熵定义为信息的期望，符号xi的信息定义为：

其中p(xi)为该分类的概率。

熵，即信息的期望值为：

计算信息熵的代码如下：

def calcShannonEnt(dataSet):

numEntries = len(dataSet)

labelCounts = {}

for featVec in dataSet:

currentLabel = featVec[-1]

if currentLabel not in labelCounts:

labelCounts[currentLabel] = 0

labelCounts[currentLabel] += 1

shannonEnt = 0

for key in labelCounts:

shannonEnt = shannonEnt - (labelCounts[key]/numEntries)*math.log2(labelCounts[key]/numEntries)

return shannonEnt

可以根据信息熵，按照获取最大信息增益的方法划分数据集。

2.划分数据集

划分数据集就是将所有符合要求的元素抽出来。

def splitDataSet(dataSet,axis,value):

retDataset = []

for featVec in dataSet:

if featVec[axis] == value:

newVec = featVec[:axis]

newVec.extend(featVec[axis+1:])

retDataset.append(newVec)

return retDataset

3.选择最好的数据集划分方式

信息增益是熵的减少或者是信息无序度的减少。

def chooseBestFeatureToSplit(dataSet):

numFeatures = len(dataSet[0]) - 1

bestInfoGain = 0

bestFeature = -1

baseEntropy = calcShannonEnt(dataSet)

for i in range(numFeatures):

allValue = [example[i] f

最低0.47元/天解锁文章

极萨学院冷哲

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
决策树分类代码python_python编写分类决策树的代码

决策树通常在机器学习中用于分类。优点：计算复杂度不高，输出结果易于理解，对中间值缺失不敏感，可以处理不相关特征数据。缺点：可能会产生过度匹配问题。适用数据类型：数值型和标称型。1.信息增益划分数据集的目的是：将无序的数据变得更加有序。组织杂乱无章数据的一种方法就是使用信息论度量信息。通常采用信息增益，信息增益是指数据划分前后信息熵的减少值。信息越无序信息熵越大，获得信息增益最高的特征就是最好的选择...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。