mahout之聚类算法——KMeans分析

最新推荐文章于 2024-08-07 13:44:45 发布

yclzh0522

最新推荐文章于 2024-08-07 13:44:45 发布

阅读量1.2w

点赞数

分类专栏：数据挖掘文章标签：算法数据挖掘 input c

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/yclzh0522/article/details/6839641

版权

本文介绍了K-Means聚类算法的基本原理和Mahout库中的实现细节。KMeans算法通过迭代更新聚类中心，直到满足收敛条件。在Mahout中，KMeans算法包括输入数据点、计算迭代中心、输出到指定目录的过程，涉及KMeansMapper、KMeansCombiner、KMeansReducer组件。此外，讨论了参数调整，如Delta和最大迭代次数对聚类结果的影响。

摘要由CSDN通过智能技术生成

　一，K-Means聚类算法原理

k-means 算法接受参数 k ；然后将事先输入的n个数据对象划分为 k个聚类以便使得所获得的聚类满足：同一聚类中的对象相似度较高；而不同聚类中的对象相似度较小。聚类相似度是利用各聚类中对象的均值所获得一个“中心对象”（引力中心）来进行计算的。

　　K-means算法是最为经典的基于划分的聚类方法，是十大经典数据挖掘算法之一。K-means算法的基本思想是：以空间中k个点为中心进行聚类，对最靠近他们的对象归类。通过迭代的方法，逐次更新各聚类中心的值，直至得到最好的聚类结果。

　　假设要把样本集分为c个类别，算法描述如下：

　　（1）适当选择c个类的初始中心；

　　（2）在第k次迭代中，对任意一个样本&#x

最低0.47元/天解锁文章

关注

0
点赞
踩
4

收藏

觉得还不错? 一键收藏
1
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论 1

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。