目录
order by:单reduce排序
order by 会对数据进行一次全局排序,所以说,只要hive的sql中指定了order by,那么所有的数据都会到同一个reducer进行处理(不管有多少map,也不管文件有多少的block只会启动一个reducer)。
order by 只在一个reduce中进行,所以数据量特别大的时候效率非常低。建议在小的数据集中使用order by进行排序
可以通过设置hive.mapred.mode参数控制执行方式:
若选择strict,则order by 需要指定limit(若有分区还有指定哪个分区)
若为nostrict,则limit不是必需的
即使设置了mapreduce.job.reduces的值大于1, 使用order by,时Hive在运行MR程序时也会设置为1覆盖
distribute by :shuffle分发
distribute by:保证相同的分区键在同一个分区内(一个分区内可能有多个分区键)
distribute by 是控制map的输出在reducer是如何划分的,作用于shuffle阶段
distribute by 采集hash算法,在map端将查询结果中hash值相同的结果分发到对应的reduce文件中。
hive会根据distribute by后面列,