Hive 的 distribute by

原创于 2013-07-09 14:56:23 发布 · 2.8w 阅读

7 ·

CC 4.0 BY-SA版权

大数据专栏收录该内容

1 篇文章

订阅专栏

本文介绍了Hive中两种排序方式：Orderby和Sortby的区别及应用场景，特别强调了Sortby与Distributeby配合使用的场景，例如按年份和气温对气象数据进行排序并聚合。

Order by 能够预期产生完全排序的结果，但是它是通过只用一个reduce来做到这点的。所以对于大规模的数据集它的效率非常低。在很多情况下，并不需要全局排序，此时可以换成Hive的非标准扩展sort by。Sort by为每个reducer产生一个排序文件。在有些情况下，你需要控制某个特定行应该到哪个reducer，通常是为了进行后续的聚集操作。Hive的distribute by 子句可以做这件事。

// 根据年份和气温对气象数据进行排序，以确保所有具有相同年份的行最终都在一个reducer分区中

From record2
select year, temperature
distribute by year
sort by year asc, temperature desc;

因此，distribute by 经常和 sort by 配合使用。