大数据处理技术导论(4) | Datawhale组队学习46期

项目地址 https://github.com/datawhalechina/juicy-bigdata,感谢项目团队的付出。
本次主要学习 mapreduce 相关内容。

1. mapreduce 概述

mapreduce 是 google 提出的分布式并行编程框架。hadoop mapreduce (下文中的 mapreduce 指 hadoop reduce)是其开源实现。运行于 HDFS 系统之上,处理效率高、使用门槛低,一经提出便受到了广大程序员的喜爱。

mapreduce 设计理念遵循 让程序计算靠近数据 ,因为数据需要大量的网络开销,让数据靠近程序 的理念效率较低。
在这里插入图片描述

2. mapreduce 核心流程

mapreduce 核心流程有 map、shuffle、reduce 3个阶段。
wordcount
shuffle

如上图所示:

  • map 阶段:将输入按照 key 进行分组;
  • shuffle 阶段:将 map 处理结果进行分区排序、合并(key相同,value 值进行本地汇总 )
map-1:
k1, v1 
k1, v2

map-2:
k1, v3 
k1, v4 
k2, v5
k2, v6 
----> 
map-1:
k1, v1+v2

map-2:
k1, v3+v4
k2, v5+v6

)形成大量的溢出文件,而后,将大量的溢出文件归并(按照 key 进行整体排序整合)为少量的大文件;

map-1:
k1, v1+v2

map-2:
k1, v3+v4 
k2, v5+v6

----> 
k1,[v1+v2,v3+v4]
k2,[v5+v6]
  • reduce 阶段:获取 shuffle 结果,进行汇总计算 。
k1, v1+v2+v3+v4
k2, v5+v6
  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值