SKLearn分类树在合成数集上的表现

最新推荐文章于 2023-10-14 11:10:17 发布

九天&菜菜&菊安酱

最新推荐文章于 2023-10-14 11:10:17 发布

阅读量485

点赞数 1

分类专栏： Sklearn 决策树算法机器学习文章标签：决策树 sklearn 不同数据集分类树效果

本文链接：https://blog.csdn.net/qq_41954204/article/details/98177968

版权

机器学习同时被 3 个专栏收录

13 篇文章 2 订阅

订阅专栏

Sklearn

7 篇文章 0 订阅

订阅专栏

决策树算法

3 篇文章 0 订阅

订阅专栏

本文介绍了如何使用SKLearn在合成数据集上构建和评估决策树。通过生成月亮型、环形和二分型数据，探讨了决策树在不同数据分布下的分类效果，展示了决策边界的可视化，并指出分类树在处理环形数据时的局限性。

摘要由CSDN通过智能技术生成

SKLearn分类树在合成数集上的表现

小伙伴们大家好~o(￣▽￣)ブ，我是菜菜，这里是我的sklearn课堂

我的开发环境是Jupyter lab，所用的库和版本大家参考：

Python 3.7.1（你的版本至少要3.4以上

Scikit-learn 0.20.0 （你的版本至少要0.20

Graphviz 0.8.4 (没有画不出决策树哦，安装代码conda install python-graphviz

Numpy 1.15.3, Pandas 0.23.4, Matplotlib 3.0.1, SciPy 1.1.0

在这里，我们使用SKlearn构建三种不同分布的数据，然后在这些数据集上测试一下决策树的效果，让大家更好地理解决策树。下图就是三种表现结果，后面会详细介绍实现过程~

1. 导入需要的库

import numpy as np
import matplotlib.pyplot as plt
from matplotlib.colors import ListedColormap
from sklearn.model_selection import train_test_split
from sklearn.preprocessing import StandardScaler
from sklearn.datasets import make_moons, make_circles, make_classification
from sklearn.tree import DecisionTreeClassifier

2. 生成三种数据集

我们先从sklearn自带的数据库中生成三种类型的数据集：1）月亮型数据，2）环形数据，3）二分型数据

#make_classification库生成随机的二分型数据
X, y = make_classification(n_samples=100,
                           n_features=2,  
                           n_redundant=0, 
                           n_informative=2, 
                           random_state=1,  
                           n_clusters_per_class=1)

在这里可以查看一下X和y，其中X是100行带有两个2特征的数据，y是二分类标签
也可以画出散点图来观察一下X中特征的分布：

plt.scatter(X[:,0],X[:,1]);

合成数据散点图

从图上可以看出，生成的二分型数据的两个簇离彼此很远，这样不利于我们测试分类器的效果，因此我们使用np生成随机数组，通过让已经生成的二分型数据点加减0~1之间的随机数，使数据分布变得更散更稀疏。

【注意】这个过程只能够运行一次，因为多次运行之后X会变得非常稀疏，两个簇的数据会混合在一起，分类器的效应会继续下降

rng = np.random.RandomState(2)      #生成一种随机模式
X += 2 * rng.uniform(size=X.shape)  #加减0~1之间的随机数
linearly_separable = (X, y)

生成了新的X，依然可以画散点图来观察一下特征的分布：

plt.scatter(X[:,0],X[:,1]);

离散后的散点图

#生成数据集
datasets = [make_moons(noise=0.3, random_state=0),
            make_circles(noise=0.2, factor=0.5, random_state=1),
            linearly_separable]

3. 画出三种数据集和三棵决策树的分类效应图像

figure = plt.figure(figsize=(6, 9))
i = 1
for ds_index, ds in enumerate(datasets):
    X, y = ds
    X = StandardScaler().fit_transform(X) 
    X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=.4, random_state=42)
    
    #找出数据集中两个特征的最大值和最小值，创造一个比两个特征的区间本身更大一点的区间
    x1_min, x1_max = X[:, 0].min() - .5, X[:, 0].max() + .5
    x2_min, x2_max = X[:, 1].min() - .5, X[:, 1].max() + .5
    
    #用特征向量生成网格数据，网格数据，其实就相当于坐标轴上无数个点
    array1,array2 = np.meshgrid(np.arange(x1_min, x1_max, 0.2),
                         np.arange(x2_min, x2_max, 0.2))

    #接下来生成彩色画布
    cm = plt.cm.RdBu
    cm_bright = ListedColormap(['#FF0000', '#0000FF'])
    ax = plt.subplot(len(datasets), 2, i)
    
    if ds_index == 0:
        ax.set_title("Input data")
    
    #将数据集的分布放到我们的坐标系上
    ax.scatter(X_train[:, 0], X_train[:, 1], c=y_train, 
               cmap=cm_bright,edgecolors='k')
    ax.scatter(X_test[:, 0], X_test[:, 1], c=y_test, 
               cmap=cm_bright, alpha=0.6,edgecolors='k')
    
     #为图设置坐标轴的最大值和最小值，并设定没有坐标轴
    ax.set_xlim(array1.min(), array1.max())
    ax.set_ylim(array2.min(), array2.max())
    ax.set_xticks(())
    ax.set_yticks(())
    
    #每次循环之后，改变i的取值让图每次位列不同的位置
    i += 1
     
    #迭代决策树
    ax = plt.subplot(len(datasets),2,i)
    clf = DecisionTreeClassifier(max_depth=5)
    clf.fit(X_train, y_train)
    score = clf.score(X_test, y_test)
    Z = clf.predict_proba(np.c_[array1.ravel(),array2.ravel()])[:, 1]
    
    #将返回的类概率作为数据，放到contourf里面绘制去绘制轮廓
    Z = Z.reshape(array1.shape)
    ax.contourf(array1, array2, Z, cmap=cm, alpha=.8)
    
    #将数据集的分布放到我们的坐标系上
    ax.scatter(X_train[:, 0], X_train[:, 1], c=y_train, cmap=cm_bright,
               edgecolors='k')
    ax.scatter(X_test[:, 0], X_test[:, 1], c=y_test, cmap=cm_bright,
               edgecolors='k', alpha=0.6)
    
    #为图设置坐标轴的最大值和最小值
    ax.set_xlim(array1.min(), array1.max())
    ax.set_ylim(array2.min(), array2.max())
    
    #设定坐标轴不显示标尺也不显示数字
    ax.set_xticks(())
    ax.set_yticks(())
    
    #我们有三个坐标系，但我们只需要在第一个坐标系上有标题
    if ds_index == 0:
        ax.set_title("Decision Tree")
    
    #写在右下角的数字    
    ax.text(array1.max() - .3, array2.min() + .3, ('{:.1f}%'.format(score*100)),
            size=15, horizontalalignment='right')
    
    #让i继续加一
    i += 1

plt.tight_layout()
plt.show()

运行的结果如下所示：

运行结果

从图上来看，每一条线都是决策树在二维平面上画出的一条决策边界，每当决策树分枝一次，就有一条线出现。当数据的维度更高的时候，这条决策边界就会由线变成面，甚至变成我们想象不出的多维图形。

同时，很容易看得出，分类树天生不擅长环形数据。每个模型都有自己的决策上限，所以一个怎样调整都无法提升表现的可能性也是有的。当一个模型怎么调整都不行的时候，我们可以选择换其他的模型使用，不要在一棵树上吊死。顺便一说，最擅长月亮型数据的是最近邻算法，RBF支持向量机和高斯过程；最擅长环形数据的是最近邻算法和高斯过程；最擅长对半分的数据的是朴素贝叶斯，神经网络和随机森林。