hive中的Order By

hive中的order by也是对一个结果集合进行排序,但是和关系型数据库又所有不同。
这不同的地方也是两者在底层架构区别的体现。

hive的参数hive.mapred.mode是控制hive执行mapred的方式的,有两个选项:strict和nonstrict,默认值是nonstrict。
这个两个值对order by的执行有着很大的影响。

测试用例
hive> select * from test09;
OK
100 tom
200 mary
300 kate
400 tim
Time taken: 0.061 seconds

我们先来看看nonstrict的情况。

hive> set hive.mapred.mode=nonstrict;
hive> select * from test09 order by id;
Total MapReduce jobs = 1
Launching Job 1 out of 1
Number of reduce tasks determined at compile time: 1
In order to change the average load for a reducer (in bytes):
set hive.exec.reducers.bytes.per.reducer=
In order to limit the maximum number of reducers:
set hive.exec.reducers.max=
In order to set a constant number of reducers:
set mapred.reduce.tasks=
Starting Job = job_201105020924_0065, Tracking URL = http://hadoop00:50030/jobdetails.jsp?jobid=job_201105020924_0065
Kill Command = /home/hjl/hadoop/bin/../bin/hadoop job -Dmapred.job.tracker=hadoop00:9001 -kill job_201105020924_0065
2011-05-03 03:37:41,270 Stage-1 map = 0%, reduce = 0%
2011-05-03 03:37:43,292 Stage-1 map = 50%, reduce = 0%
2011-05-03 03:37:45,314 Stage-1 map = 100%, reduce = 0%
2011-05-03 03:37:50,360 Stage-1 map = 100%, reduce = 100%
Ended Job = job_201105020924_0065
OK
100 tom
200 mary
300 kate
400 tim
Time taken: 15.049 seconds

这个时候order by可以正常的执行,hive启动了一个reduce进行处理,事实上也只能启动一个reduce。

在来看看strict的情况
hive> set hive.mapred.mode=strict;
hive> select * from test09 order by id;
FAILED: Error in semantic analysis: line 1:30 In strict mode, limit must be specified if ORDER BY is present id

这个时候提示你,在strict模式下如果执行order by的操作必须要指定limit。
因为执行order by的时候只能启动单个reduce执行,如果排序的结果集过大,那么执行时间会非常漫长。

hive> select * from test09 order by id limit 4;
Total MapReduce jobs = 1
Launching Job 1 out of 1
Number of reduce tasks determined at compile time: 1
In order to change the average load for a reducer (in bytes):
set hive.exec.reducers.bytes.per.reducer=
In order to limit the maximum number of reducers:
set hive.exec.reducers.max=
In order to set a constant number of reducers:
set mapred.reduce.tasks=
Starting Job = job_201105020924_0067, Tracking URL = http://hadoop00:50030/jobdetails.jsp?jobid=job_201105020924_0067
Kill Command = /home/hjl/hadoop/bin/../bin/hadoop job -Dmapred.job.tracker=hadoop00:9001 -kill job_201105020924_0067
2011-05-03 04:18:26,828 Stage-1 map = 0%, reduce = 0%
2011-05-03 04:18:27,842 Stage-1 map = 50%, reduce = 0%
2011-05-03 04:18:29,864 Stage-1 map = 100%, reduce = 0%
2011-05-03 04:18:35,916 Stage-1 map = 100%, reduce = 100%
Ended Job = job_201105020924_0067
OK
100 tom
200 mary
300 kate
400 tim
Time taken: 15.706 seconds

加上limit后,SQL成功执行。

 

本文转自http://www.oratea.net/?p=622

### 回答1: Hiveorder by和sort by都是用于对查询结果进行排序的语句,但它们的实现方式和使用场景略有不同。 order by是在查询结果生成后,对整个结果集进行排序,可以使用多个字段进行排序,但是会将整个结果集加载到内存进行排序,因此在处理大数据量时可能会出现性能问题。 sort by是在map阶段对数据进行局部排序,然后在reduce阶段进行合并,因此可以处理大数据量的排序,但是只能使用一个字段进行排序。 因此,当需要对整个结果集进行排序时,应该使用order by;当需要处理大数据量时,应该使用sort by。 ### 回答2: HiveOrder by和Sort by都是用来排序的语句,但它们有一些不同之处。 Order by是一个全局排序,它在所有数据被收集后进行排序。这意味着它需要对整个数据集进行一次排序,因此非常消耗性能和时间。在使用Order by时,会将数据全部放入内存缓存进行排序,如果数据量过大,会导致内存不足而出现错误。 Sort by是在每个Reducer操作之前发生的本地排序。这意味着Sort by只会对单个Reducer内的数据进行排序,而不需要对整个数据集进行排序。在使用Sort by时,不同的Reducer会对数据进行排序,每个Reducer生成有序的数据,最终将它们合并到一起,从而形成整个数据集的有序结果。 相比之下,Sort by的性能比Order by要好得多。因此,当需要对大量数据进行排序时,我们通常建议使用Sort by而不是Order by。但是,需要注意的是,Sort by只能在处理器上进行排序,不像Order by是在集群上进行全局排序。因此,当需要对整个数据集进行排序而不仅仅是数据分区时,应该使用Order by。 总的来说,Order by和Sort by在Hive都是用来排序的语句,它们的区别在于排序的颗粒度和性能。在实际应用,我们需要根据具体的情况,选择合适的排序方式,以便实现最佳的性能表现。 ### 回答3: Hiveorder by和sort by都是用来对查询结果进行排序的操作,但它们有一些细微的差别。 首先,order by是在所有的reduce task之后进行的全局排序,它可以对查询结果进行任意的排序操作,并且可以指定多个排序键,并且还可以指定排序顺序,包括升序和降序。但是,由于order by是在所有的reduce task之后进行的全局排序,因此需要将所有的查询结果加载到内存进行排序,所以在处理大数据量时可能会出现内存溢出的问题。 而sort by只是在各个map task进行的局部排序,它只能指定一个排序键,并且只能按照升序排序,但是它的排序是在map task结束后立即进行的,因此可以减少大量数据在内存的等待时间。因此,当处理大数据量的时候,sort by更加适用。 此外,另一个不同之处在于,order by可以用于分区表和非分区表,而sort by只能用于非分区表。 综上所述,当处理小量数据时,order by和sort by的效率差别不大,但处理大量数据时,sort by的效率要比order by高。在使用时,需要根据具体情况来选择合适的操作。
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值