k-means聚类算法及其优化

最新推荐文章于 2024-08-14 00:10:28 发布

lymboy

最新推荐文章于 2024-08-14 00:10:28 发布

阅读量5.4k

点赞数 8

本文链接：https://blog.csdn.net/lymboy/article/details/116804825

版权

本文介绍了k-means聚类算法的基本流程和其对初始质心敏感的问题。k-means++是对k-means的优化，通过确保初始聚类中心间距离最大化来提高聚类质量。文章详细阐述了k-means++的算法步骤，并指出在实际使用中，sklearn库的KMeans类默认实现了k-means++初始化。

摘要由CSDN通过智能技术生成

欢迎关注笔者的微信公众号

在机器学习中有这样一种场景，需要对已知数据按照一定的关系归到不同的类别中（无监督）

k-means是比较流行的聚类方法

其基本算法流程如下：

随机设置K个特征空间内的点作为初始的聚类中心
对于其他每个点计算到K个中心的距离，未知的点选择最近的一个聚类中心点作为标记类别
接着对着标记的聚类中心之后，重新计算出每个聚类的新中心点（平均值）
如果计算得出的新中心点与原中心点一样（质心不再移动），那么结束，否则重新进行第二步过程

# Author: Phil Roth <mr.phil.roth@gmail.com>
# License: BSD 3 clause

import numpy as np
import matplotlib.pyplot as plt

from sklearn.cluster import KMeans
from sklearn.datasets import make_blobs

plt.figure(figsize=(12, 12))

n_samples = 1500
random_state = 170
X, y = make_blobs(n_samples=n_samples, random_state=random_state)

# Incorrect number of clusters
y_pred = KMeans(n_clusters=2, random_state=random_state).fit_predict(X)

plt.subplot(221)
plt.scatter(X[:, 0], X[:, 1], c=y_pred)
plt.title("Incorrect Number of Blobs")

# Anisotropicly distributed data
transformation = [[0.60834549, -0.63667341], [-0.40887718, 0.85253229]]
X_aniso = np.dot(X, transformation)
y_pred = KMeans(n_clusters=3, random_state=random_state).fit_predict(X_aniso)

plt.subplot(222)
plt.scatter(X_aniso[:, 0], X_aniso[:, 1], c=y_pred)
plt.title("Anisotropicly Distributed Blobs")

# Different variance
X_varied, y_varied = make_blobs(n_samples=n_samples,
                                cluster_std=[1.0,