文章目录
Hadoop MapReduce(计算)
一、理解MapReduce思想
-
MapReduce的思想核心是“先分再合,分而治之”。
-
所谓“分而治之”就是把一个复杂的问题,按照一定的“分解”方法分为等价的规模较小的若干部分,然后逐个解决,分别找出各部分的结果,然后把各部分的结果组成整个问题的最终结果。
-
这种思想来源于日常生活与工作时的经验。即使是发布过论文实现分布式计算的谷歌也只是实现了这种思想,而不是自己原创。
-
Map表示第一阶段,负责“拆分”:即把复杂的任务分解为若干个“简单的子任务”来并行处理。可以进行拆分的前提是这些小任务可以并行计算,彼此间几乎没有依赖关系。
-
Reduce表示第二阶段,负责“合并”:即对map阶段的结果进行全局汇总。
-
这两个阶段合起来正是MapReduce思想的体现。
-
一个比较形象的语言解释MapReduce
要数