分类与聚类

lesdiables

已于 2023-12-01 15:47:13 修改

阅读量760

点赞数

分类专栏：数据挖掘文章标签：聚类分类机器学习

于 2021-12-10 08:51:38 首次发布

本文链接：https://blog.csdn.net/lesdiables/article/details/121848328

版权

数据挖掘专栏收录该内容

10 篇文章 0 订阅

订阅专栏

from sklearn.datasets import load_iris
iris = load_iris()
iris_data = iris['data'] ##提取数据集中的特征
iris_target = iris['target'] ## 提取数据集中的标签
iris_names = iris['feature_names'] ### 提取特征名

print('iris数据集的特征名为：\n',iris_names)
#sepal：花萼，petal：花瓣

iris特征集的特征名为
 ['sepal length (cm)', 'sepal width (cm)', 'petal length (cm)', 'petal width (cm)']

print('iris数据集的数据为：\n',iris_data)
print('数据集的形状为：',iris_data.shape)

iris数据集的数据为：
 [[5.1 3.5 1.4 0.2]
 [4.9 3.  1.4 0.2]
 [4.7 3.2 1.3 0.2]
 [4.6 3.1 1.5 0.2]
 [5.  3.6 1.4 0.2]
 [5.4 3.9 1.7 0.4]
 [4.6 3.4 1.4 0.3]
 [5.  3.4 1.5 0.2]
 [4.4 2.9 1.4 0.2]
 [4.9 3.1 1.5 0.1]
 [5.4 3.7 1.5 0.2]
 [4.8 3.4 1.6 0.2]
 [4.8 3.  1.4 0.1]
 [4.3 3.  1.1 0.1]
 [5.8 4.  1.2 0.2]
 [5.7 4.4 1.5 0.4]
 [5.4 3.9 1.3 0.4]
 [5.1 3.5 1.4 0.3]
 [5.7 3.8 1.7 0.3]
 [5.1 3.8 1.5 0.3]
 [5.4 3.4 1.7 0.2]
 [5.1 3.7 1.5 0.4]
 [4.6 3.6 1.  0.2]
 [5.1 3.3 1.7 0.5]
 [4.8 3.4 1.9 0.2]
 [5.  3.  1.6 0.2]
 [5.  3.4 1.6 0.4]
 [5.2 3.5 1.5 0.2]
 [5.2 3.4 1.4 0.2]
 [4.7 3.2 1.6 0.2]
 [4.8 3.1 1.6 0.2]
 [5.4 3.4 1.5 0.4]
 [5.2 4.1 1.5 0.1]
 [5.5 4.2 1.4 0.2]
 [4.9 3.1 1.5 0.2]
 [5.  3.2 1.2 0.2]
 [5.5 3.5 1.3 0.2]
 [4.9 3.6 1.4 0.1]
 [4.4 3.  1.3 0.2]
 [5.1 3.4 1.5 0.2]
 [5.  3.5 1.3 0.3]
 [4.5 2.3 1.3 0.3]
 [4.4 3.2 1.3 0.2]
 [5.  3.5 1.6 0.6]
 [5.1 3.8 1.9 0.4]
 [4.8 3.  1.4 0.3]
 [5.1 3.8 1.6 0.2]
 [4.6 3.2 1.4 0.2]
 [5.3 3.7 1.5 0.2]
 [5.  3.3 1.4 0.2]
 [7.  3.2 4.7 1.4]
 [6.4 3.2 4.5 1.5]
 [6.9 3.1 4.9 1.5]
 [5.5 2.3 4.  1.3]
 [6.5 2.8 4.6 1.5]
 [5.7 2.8 4.5 1.3]
 [6.3 3.3 4.7 1.6]
 [4.9 2.4 3.3 1. ]
 [6.6 2.9 4.6 1.3]
 [5.2 2.7 3.9 1.4]
 [5.  2.  3.5 1. ]
 [5.9 3.  4.2 1.5]
 [6.  2.2 4.  1. ]
 [6.1 2.9 4.7 1.4]
 [5.6 2.9 3.6 1.3]
 [6.7 3.1 4.4 1.4]
 [5.6 3.  4.5 1.5]
 [5.8 2.7 4.1 1. ]
 [6.2 2.2 4.5 1.5]
 [5.6 2.5 3.9 1.1]
 [5.9 3.2 4.8 1.8]
 [6.1 2.8 4.  1.3]
 [6.3 2.5 4.9 1.5]
 [6.1 2.8 4.7 1.2]
 [6.4 2.9 4.3 1.3]
 [6.6 3.  4.4 1.4]
 [6.8 2.8 4.8 1.4]
 [6.7 3.  5.  1.7]
 [6.  2.9 4.5 1.5]
 [5.7 2.6 3.5 1. ]
 [5.5 2.4 3.8 1.1]
 [5.5 2.4 3.7 1. ]
 [5.8 2.7 3.9 1.2]
 [6.  2.7 5.1 1.6]
 [5.4 3.  4.5 1.5]
 [6.  3.4 4.5 1.6]
 [6.7 3.1 4.7 1.5]
 [6.3 2.3 4.4 1.3]
 [5.6 3.  4.1 1.3]
 [5.5 2.5 4.  1.3]
 [5.5 2.6 4.4 1.2]
 [6.1 3.  4.6 1.4]
 [5.8 2.6 4.  1.2]
 [5.  2.3 3.3 1. ]
 [5.6 2.7 4.2 1.3]
 [5.7 3.  4.2 1.2]
 [5.7 2.9 4.2 1.3]
 [6.2 2.9 4.3 1.3]
 [5.1 2.5 3.  1.1]
 [5.7 2.8 4.1 1.3]
 [6.3 3.3 6.  2.5]
 [5.8 2.7 5.1 1.9]
 [7.1 3.  5.9 2.1]
 [6.3 2.9 5.6 1.8]
 [6.5 3.  5.8 2.2]
 [7.6 3.  6.6 2.1]
 [4.9 2.5 4.5 1.7]
 [7.3 2.9 6.3 1.8]
 [6.7 2.5 5.8 1.8]
 [7.2 3.6 6.1 2.5]
 [6.5 3.2 5.1 2. ]
 [6.4 2.7 5.3 1.9]
 [6.8 3.  5.5 2.1]
 [5.7 2.5 5.  2. ]
 [5.8 2.8 5.1 2.4]
 [6.4 3.2 5.3 2.3]
 [6.5 3.  5.5 1.8]
 [7.7 3.8 6.7 2.2]
 [7.7 2.6 6.9 2.3]
 [6.  2.2 5.  1.5]
 [6.9 3.2 5.7 2.3]
 [5.6 2.8 4.9 2. ]
 [7.7 2.8 6.7 2. ]
 [6.3 2.7 4.9 1.8]
 [6.7 3.3 5.7 2.1]
 [7.2 3.2 6.  1.8]
 [6.2 2.8 4.8 1.8]
 [6.1 3.  4.9 1.8]
 [6.4 2.8 5.6 2.1]
 [7.2 3.  5.8 1.6]
 [7.4 2.8 6.1 1.9]
 [7.9 3.8 6.4 2. ]
 [6.4 2.8 5.6 2.2]
 [6.3 2.8 5.1 1.5]
 [6.1 2.6 5.6 1.4]
 [7.7 3.  6.1 2.3]
 [6.3 3.4 5.6 2.4]
 [6.4 3.1 5.5 1.8]
 [6.  3.  4.8 1.8]
 [6.9 3.1 5.4 2.1]
 [6.7 3.1 5.6 2.4]
 [6.9 3.1 5.1 2.3]
 [5.8 2.7 5.1 1.9]
 [6.8 3.2 5.9 2.3]
 [6.7 3.3 5.7 2.5]
 [6.7 3.  5.2 2.3]
 [6.3 2.5 5.  1.9]
 [6.5 3.  5.2 2. ]
 [6.2 3.4 5.4 2.3]
 [5.9 3.  5.1 1.8]]
数据集的形状为： (150, 4)

print('iris特征集的标签为：\n',iris_target)
print('标签集的形状为：',iris_target.shape)
print('标签的含义：',iris.target_names)

iris特征集的标签为：
 [0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0 0
 0 0 0 0 0 0 0 0 0 0 0 0 0 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1
 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 1 2 2 2 2 2 2 2 2 2 2 2
 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2 2
 2 2]
标签集的形状为： (150,)
标签的含义： ['setosa' 'versicolor' 'virginica']

from sklearn.model_selection import train_test_split
iris_data_train,iris_data_test,iris_target_train,iris_target_test = \
train_test_split(iris_data,iris_target,
      test_size = 0.2,random_state = 22)
print('训练集数据的形状为：',iris_data_train.shape)
print('训练集标签的形状为：',iris_target_train.shape)
print('测试集数据的形状为：',iris_data_test.shape)
print('测试集标签的形状为：',iris_target_test.shape)

训练集数据的形状为： (120, 4)
训练集标签的形状为： (120,)
测试集数据的形状为： (30, 4)
测试集标签的形状为： (30,)

from sklearn.neighbors import KNeighborsClassifier 
# 定义一个距离判别分类器对象
knn = KNeighborsClassifier()
#k近邻算法，有监督学习，分类算法
# 调用该对象的训练方法，主要接收两个参数：训练数据集及其样本标签
knn.fit(iris_data_train, iris_target_train)

KNeighborsClassifier(algorithm='auto', leaf_size=30, metric='minkowski',
                     metric_params=None, n_jobs=None, n_neighbors=5, p=2,
                     weights='uniform')

# 调用该对象的测试方法，主要接收一个参数：测试数据集
iris_target_predict = knn.predict(iris_data_test)
# 输出测试数据集的预测标签
print('测试数据集的预测标签为：\n ', 
      iris.target_names[iris_target_predict])

测试数据集的预测标签为：
  ['setosa' 'virginica' 'versicolor' 'virginica' 'versicolor' 'versicolor'
 'versicolor' 'virginica' 'versicolor' 'setosa' 'virginica' 'versicolor'
 'virginica' 'virginica' 'setosa' 'virginica' 'versicolor' 'versicolor'
 'versicolor' 'versicolor' 'setosa' 'virginica' 'setosa' 'versicolor'
 'virginica' 'setosa' 'virginica' 'virginica' 'virginica' 'virginica']

# 输出测试数据集的正确标签，以方便对比
print('测试数据集的正确标签为：\n ', 
      iris.target_names[iris_target_test])

测试数据集的正确标签为：
  ['setosa' 'virginica' 'versicolor' 'virginica' 'versicolor' 'versicolor'
 'versicolor' 'virginica' 'versicolor' 'setosa' 'virginica' 'versicolor'
 'virginica' 'virginica' 'setosa' 'virginica' 'versicolor' 'versicolor'
 'virginica' 'versicolor' 'setosa' 'virginica' 'setosa' 'versicolor'
 'virginica' 'setosa' 'virginica' 'virginica' 'virginica' 'virginica']

from sklearn.preprocessing import MinMaxScaler
#离差标准化：x-min(x)/max(x)-min(x)
scale = MinMaxScaler().fit(iris_data)## 训练规则
iris_dataScale = scale.transform(iris_data) ## 应用规则

from sklearn.cluster import KMeans
kmeans = KMeans(n_clusters = 3,
    random_state=123).fit(iris_dataScale) ##构建并训练模型
#kmeans算法，无监督学习，聚类算法
#print('构建的K-Means模型为：\n',kmeans)

构建的K-Means模型为：
 KMeans(algorithm='auto', copy_x=True, init='k-means++', max_iter=300,
       n_clusters=3, n_init=10, n_jobs=None, precompute_distances='auto',
       random_state=123, tol=0.0001, verbose=0)

result = kmeans.predict([[1.5,1.5,1.5,1.5]])
print('花瓣花萼长度宽度全为1.5的鸢尾花预测类别为：', result[0])

花瓣花萼长度宽度全为1.5的鸢尾花预测类别为： 0

lesdiables

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
分类与聚类

from sklearn.datasets import load_irisiris = load_iris()iris_data = iris['data'] ##提取数据集中的特征iris_target = iris['target'] ## 提取数据集中的标签iris_names = iris['feature_names'] ### 提取特征名print('iris数据集的特征名为：\n',iris_names)#sepal：花萼，petal：花瓣iris特征集的特征名为.
复制链接

扫一扫