mahout之聚类算法——KMeans分析

本文介绍了K-Means聚类算法的基本原理和Mahout库中的实现细节。KMeans算法通过迭代更新聚类中心,直到满足收敛条件。在Mahout中,KMeans算法包括输入数据点、计算迭代中心、输出到指定目录的过程,涉及KMeansMapper、KMeansCombiner、KMeansReducer组件。此外,讨论了参数调整,如Delta和最大迭代次数对聚类结果的影响。
摘要由CSDN通过智能技术生成

    一,K-Means聚类算法原理

        k-means 算法接受参数 k ;然后将事先输入的n个数据对象划分为 k个聚类以便使得所获得的聚类满足:同一聚类中的对象相似度较高;而不同聚类中的对象相似度较小。聚类相似度是利用各聚类中对象的均值所获得一个“中心对象”(引力中心)来进行计算的。

  K-means算法是最为经典的基于划分的聚类方法,是十大经典数据挖掘算法之一。K-means算法的基本思想是:以空间中k个点为中心进行聚类,对最靠近他们的对象归类。通过迭代的方法,逐次更新各聚类中心的值,直至得到最好的聚类结果。

  假设要把样本集分为c个类别,算法描述如下:

  (1)适当选择c个类的初始中心;

  (2)在第k次迭代中,对任意一个样本&#x

评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值