SQL的执行顺序

最新推荐文章于 2024-06-27 16:15:36 发布

我是方小磊

最新推荐文章于 2024-06-27 16:15:36 发布

阅读量2.6k

点赞数 1

分类专栏： Hive面试

原文链接：https://blog.csdn.net/u014044812/article/details/51004754

版权

Hive面试专栏收录该内容

12 篇文章 5 订阅

订阅专栏

本文详细解析了SQL查询语句的执行顺序，包括FROM、JOIN、WHERE、GROUP BY、HAVING、SELECT、DISTINCT、ORDER BY和LIMIT等步骤。强调了ON和WHERE在OUTER JOIN中的区别，以及在WHERE中指定条件与在HAVING中指定条件的不同影响。同时，提醒读者注意SQL书写顺序并不等于执行顺序，并给出了优化查询性能的建议。

摘要由CSDN通过智能技术生成

执行顺序

首先要明白的就是，在我们日常写sql的过程中，往往select是从一行开始写的，但是实际上却往往是很后面才会执行的。所以sql的书写顺序并不代表执行顺序。

下面列了一般的执行顺序：

from
join
on
where
group by
avg, sum等聚合函数
having
select
distinct
order by
limit

以上每个步骤都会产生一个虚拟表，该虚拟表被用作下一个步骤的输入。这些虚拟表对调用者(客户端应用程序或者外部查询)不可用。只有最后一步生成的表才会会给调用者。如果没有在查询中指定某一个子句，将跳过相应的步骤。

从中可以总结发现：

第一步：肯定从FROM开始，对 FROM 子句中的前两个表（有可能有多个表）执行笛卡尔积(交叉联接)，生成虚拟表 VT1。
第二步：对 VT1 应用 ON 筛选器，只有那些使为真才被插入到 TV2。
第三步：如果指定了 OUTER JOIN，这一步就是添加外部行。保留表中未找到匹配的行将作为外部行添加到 VT2，生成 TV3。

如果 FROM 子句包含两个以上的表，则对上一个联接生成的结果表和下一个表重复执行步骤 1 到步骤 3，直到处理完所有的表位置。

第四步：对 TV3 应用 WHERE 筛选器，只有使为 true 的行才插入 TV4。

在这有个比较重要的细节不得不说一下，对于包含outer join子句的查询，就有一个让人感到困惑的问题，到底在on筛选器还是用where筛选器指定逻辑表达式呢？on和where的最大区别在于，如果在on应用逻辑表达式那么在第三步outer join中还可以把移除的行再次添加回来，而where的移除的最终的。举个简单的例子，有一个学生表（班级,姓名）和一个成绩表(姓名,成绩)，我现在需要返回一个x班级的全体同学的成绩，但是这个班级有几个学生缺考，也就是说在成绩表中没有记录。为了得到我们预期的结果我们就需要在on子句指定学生和成绩表的关系（学生.姓名=成绩.姓名）那么我们是否发现在执行第二步的时候，对于没有参加考试的学生记录就不会出现在vt2中，因为他们被on的逻辑表达式过滤掉了,但是我们用left outer join就可以把左表（学生）中没有参加考试的学生找回来，因为我们想返回的是x班级的所有学生，如果在on中应用学生.班级='x’的话，left outer join会把x班级的所有学生记录找回（感谢网友康钦谋__康钦苗的指正），所以只能在where筛选器中应用学生.班级=‘x’ 因为它的过滤是最终的。

第五步：按 GROUP BY 子句中的列列表对 TV4 中的行进行分组，生成 TV5。如果应用了group by，那么后面的所有步骤都只能得到的vt5的列或者是聚合函数（count、sum、avg等）。原因在于最终的结果集中只为每个组包含一行。这一点请牢记。
第六步：应用cube或者rollup选项，为vt5生成超组，生成vt6.
第七步：对 VT6 应用 HAVING 筛选器，只有使为 true 的组插入到 VT7。having筛选器是第一个也是为唯一一个应用到已分组数据的筛选器。
第八步：处理select子句。将vt7中的在select中出现的列筛选出来。生成vt8.
第九步：应用distinct子句，将重复的行从 VT8 中删除，产生VT9。
第十步：应用order by子句。按照order_by_condition排序vt9，此时返回的一个游标，而不是虚拟表。sql是基于集合的理论的，集合不会预先对他的行排序，它只是成员的逻辑集合，成员的顺序是无关紧要的。对表进行排序的查询可以返回一个对象，这个对象包含特定的物理顺序的逻辑组织。这个对象就叫游标。正因为返回值是游标，那么使用order by 子句查询不能应用于表表达式。排序是很需要成本的，除非你必须要排序，否则最好不要指定order by，最后，在这一步中是第一个也是唯一一个可以使用select列表中别名的步骤。
第十一步：应用top选项。此时才返回结果给请求者即用户。