Mapreduce排序

最新推荐文章于 2024-06-17 17:09:20 发布

play_chess_ITmanito

最新推荐文章于 2024-06-17 17:09:20 发布

阅读量2.2k

点赞数

分类专栏： MapReduce 文章标签： mapreduce 排序 join 大数据

本文链接：https://blog.csdn.net/play_chess_ITmanito/article/details/51089200

版权

MapReduce 专栏收录该内容

2 篇文章 0 订阅

订阅专栏

1、MapReduce中排序发生在哪几个阶段？？这些排序是否可以避免，为什么？？
答：一个MapReduce作业由Map阶段和Reduce阶段两部分组成，这两阶段会对数据排序，从这个意义上说，MapReduce框架本质就是一个Distributed Sort。在Map阶段，Map Task会在本地磁盘输出一个按照key排序（采用的是快速排序）的文件（中间可能产生多个文件，但最终会合并成一个），在Reduce阶段，每个Reduce Task会对收到的数据排序，这样，数据便按照Key分成了若干组，之后以组为单位交给reduce（）处理。很多人的误解在Map阶段，如果不使用Combiner便不会排序，这是错误的，不管你用不用Combiner，Map Task均会对产生的数据排序（如果没有Reduce Task，则不会排序，实际上Map阶段的排序就是为了减轻Reduce端排序负载）。由于这些排序是MapReduce自动完成的，用户无法控制，因此，在hadoop 1.x中无法避免，也不可以关闭，但hadoop2.x是可以关闭的。
2、编写MapReduce作业时，如何做到在Reduce阶段，先对Key排序，再对Value排序？？
答：该问题通常称为”二次排序“，最常用的方法是将Value放到Key中，实现一个组合Key，然后自定义Key排序规则（为Key实现一个WritableComparable）
3、如何使用MapReduce实现两个表join?
答：可以考虑一下几种情况：（1）一个表大，一个表小（可放到内存中）；（2）两个表都是大表
第一种情况比较简单，只需将小表放到DistributedCache中即可；第二种情况常用的方法有：map-side join（要求输入数据有序，通常用户Hbase中的数据表连接），reduce-side join，semi join（半连接），具体资料可网上查询