MapReduce编程模型详解

最新推荐文章于 2024-05-14 20:05:11 发布

张伯清

最新推荐文章于 2024-05-14 20:05:11 发布

阅读量8.1k

点赞数 4

分类专栏：大数据文章标签： hadoop mapreduce

本文链接：https://blog.csdn.net/qq_40095003/article/details/89515245

版权

Hadoop MapReduce是一种用于处理海量数据的软件框架，其核心思想是“分而治之”。Mapper负责将任务分解为小任务并行处理，Reducer进行结果汇总。MapReduce流程包括Map、Shuffle（排序、分区和合并）、Reduce阶段，通过数据本地化和排序优化提高效率。Map阶段处理输入，Reducer阶段对Map结果进行合并和处理，最终输出到HDFS。

摘要由CSDN通过智能技术生成

1.1 MapReduce是什么

　　Hadoop MapReduce是一个软件框架，基于该框架能够容易地编写应用程序，这些应用程序能够运行在由上千个商用机器组成的大集群上，并以一种可靠的，具有容错能力的方式并行地处理上TB级别的海量数据集。这个定义里面有着这些关键词，

一是软件框架，二是并行处理，三是可靠且容错，四是大规模集群，五是海量数据集。

1.2 MapReduce做什么

　　MapReduce擅长处理大数据，它为什么具有这种能力呢？这可由MapReduce的设计思想发觉。MapReduce的思想就是“分而治之”。

1）Mapper负责“分”，即把复杂的任务分解为若干个“简单的任务”来处理。“简单的任务”包含三层含义：

一是数据或计算的规模相对原任务要大大缩小；二是就近计算原则，即任务会分配到存放着所需数据的节点上进行计算；三是这些小任务可以并行计算，彼此间几乎没有依赖关系。

　　（2）Reducer负责对map阶段的结果进行汇总。至于需要多少个Reducer，用户可以根据具体问题，通过在mapred-site.xml配置文件里设置参数mapred.reduce.tasks的值，缺省值为1。

一个比较形象的语言解释MapReduce：　　

我们要数图书馆中的所有书。你数1号书架，我数2号书架。这就是“Map”。我们人越多，数书就更快。

现在我们到一起，把所有人的统计数加在一起。这就是“Reduce”。

1. 3. MapReduce运行流程

这里写图片描述

map任务处理：
读取输入文件内容，解析成key、value对。对输入文件的每一行，解析成key、value对。每一个键值对调用一次map函数。

写自己的逻辑，对输入的key、value处理，转换成新的key、val

最低0.47元/天解锁文章

张伯清

关注

4
点赞
踩
22

收藏

觉得还不错? 一键收藏
0
评论
MapReduce编程模型详解

1.1 MapReduce是什么　　Hadoop MapReduce是一个软件框架，基于该框架能够容易地编写应用程序，这些应用程序能够运行在由上千个商用机器组成的大集群上，并以一种可靠的，具有容错能力的方式并行地处理上TB级别的海量数据集。这个定义里面有着这些关键词，一是软件框架，二是并行处理，三是可靠且容错，四是大规模集群，五是海量数据集。1.2 MapReduce做什么...
复制链接

扫一扫

专栏目录