distribute by与group by,order by与sort by , cluster by的区别
distribute by与group by 的区别
都是按key值划分数据 都使用reduce操作
- 唯一不同的是,distribute by只是单纯的分散数据,distribute by col – 按照col列把数据分散到不同的reduce。而
group by把相同key的数据聚集到一起,后续必须是聚合操作。 - distribute by的分区规则是根据分区字段的hash码与reduce的个数进行模除后,余数相同的分到一个区。
- distribute by 是控制map端在reduce上是如何分区的,distribute by会把相同的Key发到同一个reduce中。一般情况下可以结合sort by 使用,distribute by必须要写在sort by之前。先进行分组reduce,再进行排序(相当于mapreduce中的分区函数)。
order by与sort by 的区别
order by是全局排序
sort by只是确保每个reduce上面输出的数据有序。如果只有一个reduce时,和order by作用一样。
cluster by
把有相同值的数据聚集到一起,并排序,效果等价于 distribute by col sort by col。
即 cluster by col <==> distribute by col sort by col
1796

被折叠的 条评论
为什么被折叠?



