小白入门：python sklearn之kmeans

最新推荐文章于 2024-06-24 19:08:35 发布

weixin_43835472

最新推荐文章于 2024-06-24 19:08:35 发布

阅读量1.4k

点赞数 1

分类专栏：学习写

学习写专栏收录该内容

1 篇文章 0 订阅

订阅专栏

K均值聚类算法原理

先随机选取K个对象作为初始的聚类中心。然后计算每个对象与各个种子聚类中心之间的距离，把每个对象分配给距离它最近的聚类中心。聚类中心以及分配给它们的对象就代表一个聚类。一旦全部对象都被分配了，每个聚类的聚类中心会根据聚类中现有的对象被重新计算。这个过程将不断重复直到满足某个终止条件。终止条件可以是以下任何一个：
1)没有（或最小数目）对象被重新分配给不同的聚类。
2)没有（或最小数目）聚类中心再发生变化。
3)误差平方和局部最小。

Kmeans sklearn 实现

参数详解

sklearn.cluster.KMeans(n_clusters=8, init=’k-means++’, n_init=10, max_iter=300, tol=0.0001, precompute_distances=’auto’, verbose=0, random_state=None, copy_x=True, n_jobs=None, algorithm=’auto’)
其中：

n_clusters: 即我们的k值，一般需要多试一些值以获得较好的聚类效果。k值好坏的评估标准在下面会讲。

2）max_iter：最大的迭代次数，一般如果是凸数据集的话可以不管这个值，如果数据集不是凸的，可能很难收敛，此时可以指定最大的迭代次数让算法可以及时退出循环。

3）n_init：用不同的初始化质心运行算法的次数。由于K-Means是结果受初始值影响的局部最优的迭代算法，因此需要多跑几次以选择一个较好的聚类效果，默认是10，一般不需要改。如果你的k值较大，则可以适当增大这个值。

4）init：即初始值选择的方式，可以为完全随机选择’random’,优化过的’k-means++‘或者自己指定初始化的k个质心。一般建议使用默认的’k-means++’。

5）algorithm：有“auto”, “full” or “elkan”三种选择。“full"就是我们传统的K-Means算法， “elkan”是elkan K-Means算法。默认的"auto"则会根据数据值是否是稀疏的，来决定如何选择"full"和“elkan”。一般数据是稠密的，那么就是 “elkan”，否则就是"full”。一般来说建议直接用默认的"auto"

调用示例

from sklearn.cluster import KMeans
import numpy as np
X = np.array([[1, 2], [1, 4], [1, 0],
              [10, 2], [10, 4], [10, 0]])
kmeans = KMeans(n_clusters=2, random_state=0).fit(X)
print('labels:\n ', kmeans.labels_)
print('predict:\n ', kmeans.predict([[0, 0], [12, 3]]))
print('cluster_centers:\n ', kmeans.cluster_centers_)
plt.scatter(X[:, 0], X[:, 1],  c=kmeans.labels_) # 按照label画图
plt.show()

程序运行结果

以后继续更新~~~

weixin_43835472

关注

1
点赞
踩
5

收藏

觉得还不错? 一键收藏
0
评论
小白入门：python sklearn之kmeans

参考链接-sklearn参考链接-blog参考链接-baiduK均值聚类算法原理先随机选取K个对象作为初始的聚类中心。然后计算每个对象与各个种子聚类中心之间的距离，把每个对象分配给距离它最近的聚类中心。聚类中心以及分配给它们的对象就代表一个聚类。一旦全部对象都被分配了，每个聚类的聚类中心会根据聚类中现有的对象被重新计算。这个过程将不断重复直到满足某个终止条件。终止条件可以是以下任何一个：...
复制链接

扫一扫