《Python机器学习及实践》----无监督学习之数据聚类

最新推荐文章于 2024-05-23 00:06:56 发布

原创

最新推荐文章于 2024-05-23 00:06:56 发布 · 3.9k 阅读

5 ·

CC 4.0 BY-SA版权

文章标签：

#python #机器学习 #数据 #数据分析

本文基于《Python机器学习及实践》详细介绍了无监督学习中的数据聚类，通过实例代码展示了如何在Python环境中进行聚类分析，包括数据预处理和使用sklearn库中的聚类算法。

本片博客是根据《Python机器学习及实践》一书中的实例，所有代码均在本地编译通过。数据为从该书指定的百度网盘上下载的，或者是sklearn自带数据下载到本地使用的。
代码片段：

# coding: utf-8
# 分别导入numpy、matplotlib以及pandas，用于数学运算、作图以及数据分析。
import numpy as np
import matplotlib.pyplot as plt
import pandas as pd
# 使用pandas分别读取训练数据与测试数据集。
digits_train = pd.read_csv('D:\Source Code\machinelearn\optdigits.tra', header=None)
digits_test = pd.read_csv('D:\Source Code\machinelearn\optdigits.tes', header=None)
# 从训练与测试数据集上都分离出64维度的像素特征与1维度的数字目标。
X_train = digits_train[np.arange(64)]
y_train = digits_train[64]
X_test = digits_test[np.arange(64)]
y_test = digits_test[64]
# 从sklearn.cluster中导入KMeans模型。
from sklearn.cluster import KMeans
# 初始化KMeans模型，并设置聚类中心数量为10。
kmeans = KMeans(n_clusters=10)
kmeans.fit(X_train)
# 逐条判断每个测试图像所属的聚类中心。
y_pred = kmeans.predict(X_test)
# 从s