机器学习-决策树原理与应用

机器学习-决策树原理与应用

决策树是一种基于规则的方法,它用一组嵌套的规则进行。在树的每个决策节点处,根据判断结果进入一个分支,反复执行这种操作直到到达叶子节点,得到预测结果。这些规则是通过训练得到的而不是人工制定的。

1树形决策过程

一般将决策树设计成二叉树。与树的叶子节点,非叶子节点相对应,决策树的的节点,分为两种类型。

(1)决策节点

在这些节电处,需要进行判断以决定进入哪个分支,如用一个特征和设定好的阈值进行比较。决策几点一定有两个子节点,它是非叶子节点。

(2)叶子节点

表示最终的决策结果,他们没有子节点。对于分类问题,叶子节点中存储的是类别标签。

2分类回归树

典型的决策树又ID3,C4.5,CART(分类回归树)等,他们的区别在于树的结构与构造算噶,分类回归树既支持分类问题又支持回归问题。
分类回归树是二叉决策树,预测时从根节点开始,每次只对一个特征进行判断,然后进入左子节点或者右子节点,直到到达一个叶子节点处,得到类别值或者回归函数值.预测算法的时间复杂度与树的深度有关,判定的执行次数不超过决策树的深度。

2.1创建分类回归树

通过计算每个特征的Gini指数,来选择划分节点的最优特征。选择Gini指数小的特征作为切分点。
假设有 N N N个类,样本属于第 n n n 类的概率为 P n P_n Pn,则基尼指数为:
G i n i ( p ) = ∑ n = 1 P P n ( 1 − P n ) Gini(p)=\sum_{n=1}^PP_n(1-P_n) Gini(p)=n=1PPn(1Pn)
若数据集按特征 A 取值是否等于切分点值划分为 D 1 D_1 D1 D 2 D_2 D2 两部分,则在特征 A 下,集合 D 的基尼指数为:
G i n i ( D , A ) = ∣ D 1 ∣ D G i n i ( D 1 ) + ∣ D 2 ∣ D G i n i ( D 2 ) Gini(D,A)=\frac{|D_1|}{D}Gini(D1)+\frac{|D_2|}{D}Gini(D2) Gini(D,A)=DD1Gini(D1)+DD2Gini(D2)
然后按最优特征划分数据集

2.2减枝

由于分类回归树对特征空间不断划分,这很容易造成过拟合的问题。处理过拟合不仅需要预剪枝,还需要后剪枝。预剪枝是在建立模型阶段通过制定终止条件来提早完成划分。后剪枝则是在模型建立后,利用测试数据计算剪除部分叶节点是否会造成模型误差减少,如果是,则剪除对应的叶节点。当然,后剪枝时不仅要考虑误差是否减少,还需考虑正则项,即模型的大小。最后综合选择模型误差较小且模型简单的分类回归树

3sklearn中决策树参数意义

python的sklearn库中自带有决策树的函数,可通过from sklearn.tree import DecisionTreeClassifier加载。
criterion:gini或者entropy,前者是基尼系数,后者是信息熵。
splitter: best or random 前者是在所有特征中找最好的切分点 后者是在部分特征中,默认的”best”适合样本量不大的时候,而如果样本数据量非常大,此时决策树构建推荐”random” 。
max_features:None(所有),log2,sqrt,N 特征小于50的时候一般使用所有的
max_depth: int or None, optional (default=None) 设置决策随机森林中的决策树的最大深度,深度越大,越容易过拟合,推荐树的深度为:5-20之间。
min_samples_split:设置结点的最小样本数量,当样本数量可能小于此值时,结点将不会在划分。
min_samples_leaf: 这个值限制了叶子节点最少的样本数,如果某叶子节点数目小于样本数,则会和兄弟节点一起被剪枝。
min_weight_fraction_leaf: 这个值限制了叶子节点所有样本权重和的最小值,如果小于这个值,则会和兄弟节点一起被剪枝默认是0,就是不考虑权重问题。
max_leaf_nodes: 通过限制最大叶子节点数,可以防止过拟合,默认是"None”,即不限制最大的叶子节点数。
class_weight: 指定样本各类别的的权重,主要是为了防止训练集某些类别的样本过多导致训练的决策树过于偏向这些类别。这里可以自己指定各个样本的权重,如果使用“balanced”,则算法会自己计算权重,样本量少的类别所对应的样本权重会高。
min_impurity_split: 这个值限制了决策树的增长,如果某节点的不纯度(基尼系数,信息增益,均方差,绝对差)小于这个阈值则该节点不再生成子节点。即为叶子节点 。

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值