机器学习入门之Kmeans

最新推荐文章于 2024-02-06 19:46:51 发布

data_fan

最新推荐文章于 2024-02-06 19:46:51 发布

阅读量298

点赞数

分类专栏：机器学习

本文链接：https://blog.csdn.net/WaterWood_L/article/details/103664578

版权

机器学习专栏收录该内容

14 篇文章 0 订阅

订阅专栏

聚类

聚类分析是在数据中发现数据对象之间的关系，将数据进行分组，组内的相似性越大，组间的差别越大，则聚类效果越好

kmeans过程

选择K个点作为初始质心  
repeat  
    将每个点指派到最近的质心，形成K个簇  
    重新计算每个簇的质心  
until 簇不发生变化或达到最大迭代次数

考虑欧几里得距离的数据，使用误差平方和（Sum of the Squared Error,SSE）作为聚类的目标函数，两次运行K均值产生的两个不同的簇集，我们更喜欢SSE最小的那个。

kmeans缺陷

K-Means算法的缺陷
k均值算法非常简单且使用广泛，但是其有主要的两个缺陷：

K值需要预先给定，属于预先知识，很多情况下K值的估计是非常困难的，对于像计算全部微信用户的交往圈这样的场景就完全的没办法用K-Means进行。对于可以确定K值不会太大但不明确精确的K值的场景，可以进行迭代运算，然后找出Cost Function最小时所对应的K值，这个值往往能较好的描述有多少个簇类。
K-Means算法对初始选取的聚类中心点是敏感的，不同的随机种子点得到的聚类结果完全不同
K均值算法并不是很所有的数据类型。它不能处理非球形簇、不同尺寸和不同密度的簇，银冠指定足够大的簇的个数是他通常可以发现纯子簇。
对离群点的数据进行聚类时，K均值也有问题，这种情况下，离群点检测和删除有很大的帮助。

kmeans代码

from sklearn.cluster import KMeans
import numpy as np
X = np.array([[1, 2], [1, 4], [1, 0],
              [10, 2], [10, 4], [10, 0]])
kmeans = KMeans(n_clusters=2, random_state=0).fit(X)
kmeans.labels_

kmeans.predict([[0, 0], [12, 3]])

kmeans.cluster_centers_

data_fan

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
机器学习入门之Kmeans

聚类聚类分析是在数据中发现数据对象之间的关系，将数据进行分组，组内的相似性越大，组间的差别越大，则聚类效果越好kmeans过程选择K个点作为初始质心 repeat 将每个点指派到最近的质心，形成K个簇重新计算每个簇的质心 until 簇不发生变化或达到最大迭代次数考虑欧几里得距离的数据，使用误差平方和（Sum of the Squared Error...
复制链接

扫一扫

专栏目录