分布式计算MapReduce究竟是怎么一回事？

最新推荐文章于 2023-04-09 01:59:51 发布

阿里的泰山

最新推荐文章于 2023-04-09 01:59:51 发布

阅读量244

点赞数

分类专栏：技术文章标签： hadoop mapreduce 大数据

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/qq_46388795/article/details/128267468

版权

前言

如果要对文件中的内容进行统计，大家觉得怎么做呢？一般的思路都是将不同地方的文件数据读取到内存中，最后集中进行统计。如果数据量少还好，但是面对海量数据、大数据的场景这样真的合适吗？不合适的话，那有什么比较好的方式进行计算呢？不急，看完本文给你答案。

分布式计算思想

我们打开思路，既然文件数据遍布在各个节点上，那么我们就不把文件从各个节点加载过来，而是把算法分到各个节点进行计算，最后统一进行合并处理。这就是所谓的分布式计算。

 分布式计算将该应用分解成许多小的部分，分配给多台计算机进行处理。这样可以节约整体计算时间，大大提高计算效率。

整个思想的核心就是“先分再合，分而治之”。所谓“分而治之”就是把一个复杂的问题，按照一定的“分解”方法分为等价的规模较小的若干部分，然后逐个解决，分别找出各部分的结果，然后把各部分的结果组成整个问题的最终结果。 

那么Hadoop也借鉴了这样的思想，设计出了MapReduce计算框架。那么MapReduce框架具体设计上有什么亮点呢?

MapReduce设计思想

Hadoop在设计MapReduce的时候，吸取了分布式计算中分而治之的思想，同时需要考虑更多细节的问题。

（1）如何对付大数据处理场景

对相互间不具有计算依赖关系的大数据计算任务，实现并行最自然的办法就是采取MapReduce分而治之的策略。

首先Map阶段进行拆分，把大数据拆分成若干份小数据，多个程序同时并行计算产生中间结果；然后是Reduce聚

合阶段，通过程序对并行的结果进行最终的汇总计算，得出最终的结果。 

不可拆分的计算任务或相互间有依赖关系的数据无法进行并行计算。

（2）构建抽象编程模型

MapReduce借鉴了函数式语言中的思想，用Map和Reduce两个函数提供了高层的并行编程抽象模型。

map: 对一组数据元素进行某种重复式的处理；

reduce: 对Map的中间结果进行某种进一步的结果整理。

MapReduce中定义了如下的Map和Reduce两个抽象的编程接口，由用户去编程实现:

最低0.47元/天解锁文章

阿里的泰山

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
分布式计算MapReduce究竟是怎么一回事？

如果要对文件中的内容进行统计，大家觉得怎么做呢？一般的思路都是将不同地方的文件数据读取到内存中，最后集中进行统计。如果数据量少还好，但是面对海量数据、大数据的场景这样真的合适吗？不合适的话，那有什么比较好的方式进行计算呢？不急，看完本文给你答案。
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。