机器学习-决策树原理与应用
决策树是一种基于规则的方法,它用一组嵌套的规则进行。在树的每个决策节点处,根据判断结果进入一个分支,反复执行这种操作直到到达叶子节点,得到预测结果。这些规则是通过训练得到的而不是人工制定的。
1树形决策过程
一般将决策树设计成二叉树。与树的叶子节点,非叶子节点相对应,决策树的的节点,分为两种类型。
(1)决策节点
在这些节电处,需要进行判断以决定进入哪个分支,如用一个特征和设定好的阈值进行比较。决策几点一定有两个子节点,它是非叶子节点。
(2)叶子节点
表示最终的决策结果,他们没有子节点。对于分类问题,叶子节点中存储的是类别标签。
2分类回归树
典型的决策树又ID3,C4.5,CART(分类回归树)等,他们的区别在于树的结构与构造算噶,分类回归树既支持分类问题又支持回归问题。
分类回归树是二叉决策树,预测时从根节点开始,每次只对一个特征进行判断,然后进入左子节点或者右子节点,直到到达一个叶子节点处,得到类别值或者回归函数值.预测算法的时间复杂度与树的深度有关,判定的执行次数不超过决策树的深度。
2.1创建分类回归树
通过计算每个特征的Gini指数,来选择划分节点的最优特征。选择Gini指数小的特征作为切分点。
假设有
N
N
N个类,样本属于第
n
n
n 类的概率为
P
n
P_n
Pn,则基尼指数为:
G
i
n
i
(
p
)
=
∑
n
=
1
P
P
n
(
1
−
P
n
)
Gini(p)=\sum_{n=1}^PP_n(1-P_n)
Gini(p)=∑n=1PPn(1−Pn)
若数据集按特征 A 取值是否等于切分点值划分为
D
1
D_1
D1和
D
2
D_2
D2 两部分,则在特征 A 下,集合 D 的基尼指数为:
G
i
n
i
(
D
,
A
)
=
∣
D
1
∣
D
G
i
n
i
(
D
1
)
+
∣
D
2
∣
D
G
i
n
i
(
D
2
)
Gini(D,A)=\frac{|D_1|}{D}Gini(D1)+\frac{|D_2|}{D}Gini(D2)
Gini(D,A)=D∣D1∣Gini(D1)+D∣D2∣Gini(D2)
然后按最优特征划分数据集
2.2减枝
由于分类回归树对特征空间不断划分,这很容易造成过拟合的问题。处理过拟合不仅需要预剪枝,还需要后剪枝。预剪枝是在建立模型阶段通过制定终止条件来提早完成划分。后剪枝则是在模型建立后,利用测试数据计算剪除部分叶节点是否会造成模型误差减少,如果是,则剪除对应的叶节点。当然,后剪枝时不仅要考虑误差是否减少,还需考虑正则项,即模型的大小。最后综合选择模型误差较小且模型简单的分类回归树
3sklearn中决策树参数意义
python的sklearn库中自带有决策树的函数,可通过from sklearn.tree import DecisionTreeClassifier加载。
criterion:gini或者entropy,前者是基尼系数,后者是信息熵。
splitter: best or random 前者是在所有特征中找最好的切分点 后者是在部分特征中,默认的”best”适合样本量不大的时候,而如果样本数据量非常大,此时决策树构建推荐”random” 。
max_features:None(所有),log2,sqrt,N 特征小于50的时候一般使用所有的
max_depth: int or None, optional (default=None) 设置决策随机森林中的决策树的最大深度,深度越大,越容易过拟合,推荐树的深度为:5-20之间。
min_samples_split:设置结点的最小样本数量,当样本数量可能小于此值时,结点将不会在划分。
min_samples_leaf: 这个值限制了叶子节点最少的样本数,如果某叶子节点数目小于样本数,则会和兄弟节点一起被剪枝。
min_weight_fraction_leaf: 这个值限制了叶子节点所有样本权重和的最小值,如果小于这个值,则会和兄弟节点一起被剪枝默认是0,就是不考虑权重问题。
max_leaf_nodes: 通过限制最大叶子节点数,可以防止过拟合,默认是"None”,即不限制最大的叶子节点数。
class_weight: 指定样本各类别的的权重,主要是为了防止训练集某些类别的样本过多导致训练的决策树过于偏向这些类别。这里可以自己指定各个样本的权重,如果使用“balanced”,则算法会自己计算权重,样本量少的类别所对应的样本权重会高。
min_impurity_split: 这个值限制了决策树的增长,如果某节点的不纯度(基尼系数,信息增益,均方差,绝对差)小于这个阈值则该节点不再生成子节点。即为叶子节点 。