Kmeans 的MapReduce实现原理

最新推荐文章于 2023-10-31 14:15:39 发布

leexurui

最新推荐文章于 2023-10-31 14:15:39 发布

阅读量772

点赞数

分类专栏：并行计算与分布式计算

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/leexurui/article/details/52352059

版权

并行计算与分布式计算专栏收录该内容

16 篇文章 0 订阅

订阅专栏

1、由InputDriver对原始数据集的一个预处理，输入目录是：testdata，输出目录是：output/data

2、由CanopyDriver发起的对data的初始划分，输入目录是：output/data，输出目录是：output/clusters-0。这里我们假设样本被划分为了500份小样本文件，分散在cluster中。

3、由KmeansDriver发起的构建Cluster的第一次迭代，输入目录是：output/clusters-0，输出目录是：output/clusters-1

4、由KmeansDriver发起的构建Cluster的第二次迭代，输入目录是：output/clusters-1，输出目录是：output/clusters-2

。。。反复迭代。直至收敛。

好了，下面具体分析，上面第2步划分完以后，HDFS上暂存了500个样本文件，每个样本文件里面有10000个样本点。

这时我们需要两个质心文件（比较小的文件，存了K个质心），一个是原质心文件，另一个是更新的质心文件。

在每个map类中，首先需要的是读取原质心文件，得到K个质心，我们处理1个样本文件，对该样本文件中的每一个样本点进行处理，其中处理过程是计算这个样本点到每个质心的距离，得到最小的，于是可以给出属于哪个质心。这样对该文件中的所有10000个样本点循环玩之后，就可以得到这10000个样本点分别属于哪个质心。

然后经过Combine，shuffle 等负责将属于具体某一个质心的样本点都归为一类，然后输出。

然后在reduce类中，把所有500个样本文件都经过map处理后的结果输入给reduce类，这样便可以重新计算出该类的质心。于是reduce中便能更新这K个质心，将新的结果写入到跟新的质心文件中去。

最后用到那个Driver类。该类作用是不断提交mapreduce作业。然后每一轮作业后，比较新的质心文件和旧质心文件的差别，如果足够接近，则停止迭代。否则就用新的质心文件替代旧质心文件，进入下一次迭代。

参考

http://blog.csdn.net/jdplus/article/details/23960127

http://www.cnblogs.com/zhangchaoyang/articles/2634365.html

http://www.cnblogs.com/vivounicorn/archive/2011/10/08/2201986.html

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
Kmeans 的MapReduce实现原理

1、由InputDriver对原始数据集的一个预处理，输入目录是：testdata，输出目录是：output/data2、由CanopyDriver发起的对data的初始划分，输入目录是：output/data，输出目录是：output/clusters-0。这里我们假设样本被划分为了500份小样本文件，分散在cluster中。3、由KmeansDriver发起的构建Cluster的第一
复制链接

扫一扫

专栏目录

leexurui CSDN认证博客专家 CSDN认证企业博客

码龄13年

76: 原创

19万+: 周排名

153万+: 总排名

14万+: 访问

: 等级

1601: 积分

26: 粉丝

27: 获赞

7: 评论

109: 收藏

私信

关注

热门文章

分类专栏

最新评论

argc和argv的定义和用法
魈魈哦-: 终于看懂了！
Python的Nltk包安装使用
qq_39729494: 是不是Temp啊？
Python的Nltk包安装使用
qq_39729494: 大佬，我找不到/local/share，local中share的地方
scikitlearn/theano多分类问题详解
OCC1994: 您好我也是按照DBN那个例子做的训练也是想要得到最后具体的预测值按照您那个预测函数我跑了一下出现这样的错误：Input variables of a Theano function should be contained in a list, even when there is a single input. 我查了一下源码，貌似是指DBN_model.logLayer.y_pred不是一个数组或者元组，请问您出现过这样的问题吗？谢谢！
评分卡模型剖析之一（woe、I…
w7bmz:

最新文章

目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。