理解MapReduce原理_mr

最新推荐文章于 2021-08-11 10:58:01 发布

炼丹师666

最新推荐文章于 2021-08-11 10:58:01 发布

阅读量246

点赞数

分类专栏：大数据

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/wj1298250240/article/details/103931203

版权

大数据专栏收录该内容

65 篇文章 2 订阅

订阅专栏

用自己的话概况一下

MapReduce是一个基于集群的计算平台，是一个简化分布式编程的计算框架，是一个将分布式计算抽象为Map和Reduce两个阶段的编程模型。（这句话记住了是可以用来装逼的）

基本概念–job和task

作业job是客户端要求执行的一个工作单元
– 输入数据、MapReduce程序、配置信息
• 任务task是MapReduce将作业拆成的小单元
– map任务和reduce任务
• Job Tracker节点（master）
– 调度task在Task Tracker上运行，协调所有作业运行
– 如果一个task失败，Job Tracker指定一个Task Tracker重新开始
• Task Tracker节点（worker）
– 执行任务，发送进度报告

分片的定义
– MapReduce把输入的数据划分成等长的小数据块，称为输入分片input split，简称分片

• 分片大小
– 分片越小，负载越平衡
– 异构时根据计算机性能分配任务个数
– 失败重启更加平衡
– 分片越小，框架开销越大

– 每个分片一个map任务
– 管理分配的总时间和构建map任务时间变大
– 默认HDFS块大小，128MB

• 计算数据本地化
– 在本地存有HDFS数据的节点上运行map任务
在这里插入图片描述
图解：

MapReduce详细过程

• 一个split（切片）起一个map任务
• map输出时会先将输出中间结果写入到buffer中 • 在buffer中对数据进行partition（分区，partition数为reduce数）和基于key的sort（排序），达到阈
值后spill到本地磁盘
• 在map任务结束之前，会对输出的多个文件进行merge（合并），合并成一个文件
• 每个reduce任务会从多个map输出中拷贝自己的partition
• reduce也会将数据先放到buffer中，达到阈值会写到磁盘
• 当数据该reduce的map输出全部拷贝完成，合并多个文件成一个文件，并保持基于key的有序
• 最后，执行reduce阶段，运行我们实现的reduce中化简逻辑，最终将结果直接输出到HDFS中

可以参考这：
https://www.jianshu.com/p/ca165beb305b

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。