MapReduce工作原理

最新推荐文章于 2022-12-13 22:52:41 发布

riwanba

最新推荐文章于 2022-12-13 22:52:41 发布

阅读量1k

点赞数

文章标签： mapreduce 大数据

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/riwanba/article/details/127354127

版权

1.从HDFS中读取数据,并按照block块(128M)划分split(128M),每个split对应一个maptask

2.map对每个分片的每行数据进行(key,value)处理,得到中间数据

3.将中间数据储存到环形缓冲区(默认100M),并给每个键值对赋予partition属性,当文件大小达到阈值时生成一个小文件写入磁盘,并再写入前根据key值进行排序(溢写过程)

4.溢写过程完成后,将所有小文件进行归并形成一个正式输出文件,此时的归并是将所有文件中相同的partition合并到一起,并对partition中的数据进行排序

5.reduce端根据分区开启相同数量的reduce task,reduce task从每个maptask形成的文件中拉取分区数据,并进行合并排序,每个reducetask处理一个分区的数据.

6.进行reduce过程,产生最终输出结果,将结果写入HDFS

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

riwanba CSDN认证博客专家 CSDN认证企业博客

码龄5年

19: 原创

136万+: 周排名

142万+: 总排名

1万+: 访问

: 等级

210: 积分

3: 粉丝

8: 获赞

4: 评论

47: 收藏

私信

关注

热门文章

最新评论

finalshell 连接出现channel is not opened问题
CSDN-Ada助手: 恭喜您写了第19篇博客！看到您解决了finalshell连接中出现的"channel is not opened"问题，我感到非常高兴。您的经验分享对其他用户来说一定非常有帮助。在接下来的创作中，我建议您可以继续分享一些关于finalshell的高级技巧或者更深入的使用案例。这样可以进一步拓宽读者的视野，帮助他们更好地应对各种可能遇到的问题。谦虚地说，我相信您在这个领域的知识和经验还有很多可以分享的。期待您的下一篇博客！祝您继续创作的过程中愉快并取得更大的成功！
selenium 下 chrome 和 chromedriver的版本保持
CSDN-Ada助手: 恭喜您写了第19篇博客！标题中提到的"版本保持"非常重要，对于使用selenium和chromedriver的开发者来说是一项关键任务。您的博客内容无疑会帮助到很多人解决这个问题。不过，如果您愿意，我想提供一些建议来丰富您的创作。下一步，您可以考虑探讨如何在不同操作系统和浏览器版本中保持selenium、chrome和chromedriver的兼容性。这个话题也是开发者们面临的挑战之一，他们会非常乐意看到您的经验和建议。另外，您还可以分享一些实际的案例和解决方案，以帮助读者更好地理解和应用这些技术。再次恭喜您，并期待您在未来的博客中分享更多有价值的内容！ CSDN 会根据你创作的博客的质量，给予优秀的博主博客红包奖励。请关注 https://bbs.csdn.net/forums/csdnnews?typeId=116148&utm_source=csdn_ai_ada_blog_reply19 看奖励名单。

大家在看

最新文章

目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。