KMeans

麓山coder

于 2017-02-22 20:30:31 发布

阅读量299

点赞数

分类专栏：机器学习

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/tercel_w/article/details/56496250

版权

机器学习专栏收录该内容

15 篇文章 0 订阅

订阅专栏

给定样本集 $D={x_1,x_2,\cdots, x_m}$ , “k均值”算法针对聚类所得簇划分 $C={C_1,\cdots, C_k}$ 最小化平方误差

E = \sum i = 1 K \sum x \in c i | | x - u i | | 2

$E= \sum_{i=1}^K\sum_{x\in c_i}||x-u_i||^2$
其中

ui=1|ci|∑x∈cIx $u_i = \frac{1}{|c_i|}\sum_{x \in c_I}x$ 是簇

ci $c_i$ 的均值向量。上式在一定程度上刻画了簇内样本围绕簇均值向量的紧密程度，E值越小则簇内样本相似度越高

算法

输入：样本集 $D={x_1,x_2,\cdots,x_m}$ ;

聚类数K，

从D中随机选择K个样本作为初始均值向量 $\{\mu_1,\cdots, \mu_k\}$

令 $c_i =\emptyset \quad (1\leq i \leq K)$

repeat

for j=1,2,…,m do

计算样本 $x_j$ 与各均值向量 $\mu_i (1 \leq i \leq k)$ 的距离： $d_{ji}= ||x_i-\mu_i||_2$ ;

根据距离最近的均值向量确定 $x_i$ 的簇标记： $\lambda_j =\arg \min_{i \in \{1,2,\cdots,k\}} d_{ji}$ ;

将样本 $x_j$ 划入相应的簇： $c_{\lambda_j}= c_{\lambda_j} \bigcup \{x_j\}$ ;

end for

for i =1,2,…,k do

计算新均值向量： $\mu_i'= \frac 1{|C_i|}\sum_{x\in c_i}x$

if $\mu_i' \neq u_i$ then

$\mu_i = \mu_i'$

end if

end for

until 当前均值向量均为更新

输出：划分簇 $C={c_1,c_2,…,c_k}$

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
KMeans

给定样本集D=x1,x2,⋯,xmD={x_1,x_2,\cdots, x_m}, “k均值”算法针对聚类所得簇划分C=C1,⋯,CkC={C_1,\cdots, C_k}最小化平方误差 E=∑i=1K∑x∈ci||x−ui||2E= \sum_{i=1}^K\sum_{x\in c_i}||x-u_i||^2 其中ui=1|ci|∑x∈cIxu_i = \frac{1}{|c_i|}\su
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。