K-均值聚类算法

最新推荐文章于 2024-05-14 14:43:43 发布

曾记否？

最新推荐文章于 2024-05-14 14:43:43 发布

阅读量1.6k

点赞数 3

分类专栏：机器学习文章标签： python 机器学习 K-均值聚类

本文链接：https://blog.csdn.net/qq_38607035/article/details/82764515

版权

简介

K-均值聚类算法是发现给定数据集的k个簇的算法。簇个数k是用户给定的，每一个簇通过其质心(centroid) , 即簇中所有点的中心来描述。

工作流程

首先，随机确定k个初始点作为质心。然后将数据集中的每个点分配到一个簇中，具体来讲，为每个点找距其最近的质心，并将其分配给该质心所对应的簇。这一步完成之后，每个簇的质心更新为该簇所有点的平均值。

上述过程的伪代码表示如下：

创建k个点作为起始质心（经常是随机选择）
当任意一个点的簇分配结果发生改变时
　　对数据集中的每个数据点
　　　　对每个质心
　　　　　　计算质心与数据点之间的距离
　　　　将数据点分配到距其最近的簇
　　对每一个簇，计算簇中所有点的均值并将均值作为质心

算法工作流程举例可参考机器理解大数据的秘密：聚类算法深度详解
在这里插入图片描述

源码

出自《机器学习实战》10.1节，源码可点击这里下载

python版本：2.7

文件名：kMeans.py

#-*- coding: UTF-8 -*- 
from numpy import *

#从txt文件中加载数据集
def loadDataSet(fileName):      #general function to parse tab -delimited floats
    dataMat = []                #assume last column is target value
    fr = open(fileName)
    for line in fr.readlines():
        curLine = line.strip().split('\t')
        fltLine = map(float,curLine) #map all elements to float()
        dataMat.append(fltLine)
    return dataMat

# 计算欧式距离
def distEclud(vecA, vecB):
    return sqrt(sum(power(vecA - vecB, 2))) #la.norm(vecA-vecB)

# 给定数据集构建一个包含k个随机质心的集合
def randCent(dataSet, k):
    n = shape(dataSet)[1]
    centroids = mat(zeros((k,n)))#create centroid mat
    for j in range(n):#create random cluster centers, within bounds of each dimension
        minJ = min(dataSet

最低0.47元/天解锁文章

曾记否？

关注

3
点赞
踩
8

收藏

觉得还不错? 一键收藏
0
评论
K-均值聚类算法

K-均值聚类算法简介K-均值是发现给定数据集的k个簇的算法。簇个数k是用户给定的，每一个簇通过其质心(centroid) , 即簇中所有点的中心来描述。工作流程首先，随机确定k个初始点作为质心。然后将数据集中的每个点分配到一个簇中，具体来讲，为每个点找距其最近的质心，并将其分配给该质心所对应的簇。这一步完成之后，每个簇的质心更新为该簇所有点的平均值。上述过程的伪代码表示如下：创建k个点...
复制链接

扫一扫