Hive中order by ,distribute by ,sort by ,cluster by 作用与区别(带图分析)

1.order  by

hive中的order by会对查询结果集执行一个全局排序,这也就是说map阶段中所有数据会在一个ruduce中进行处理,对于大数据集是一个很大的消耗

使用场景:当需要对查询结果进行全局排序,并且数据量较小的情况下,可以使用order by。

2.sort by

hive中的sort by 是执行一个局部排序的过程。这可以保证每个ruduce输出的数据是有序的,但并非全局有序。

使用场景:前提reduce个数大于1,当需要按照指定的列对查询结果进行局部排序,而不要求全局有序时,可以使用sort by。

3.distribute by(不会对reduce中数据排序)

distribute by 控制map的输出在reduce中如何划分的;MapReduce框架依据map输入的key值计算想用的hash值,然后按照得到的hash值将键值对均匀分布到多个reduce中。sort by 是对每个reduce排序,redue中会有一部分数据相同,会造成一部分数据重叠。比如统计同一年的数据,这时候可以使用distribute by将相同数据分到一个reduce中,然后再用sort by

使用场景:distribute by通常与sort by或cluster by一起使用,以控制数据的分区和排序。当需要按照指定的列对数据进行分发,并且可能需要后续的排序操作时,可以使用distribute by。

4.cluster by

cluster by 不仅有distribute by的功能,还会有reduce中的数据进行排序,相当于

cluster by=distribute by+sort by

  • 1
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 1
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值