执行顺序
首先要明白的就是,在我们日常写sql的过程中,往往select是从一行开始写的,但是实际上却往往是很后面才会执行的。所以sql的书写顺序并不代表执行顺序。
下面列了一般的执行顺序:
- from
- join
- on
- where
- group by
- avg, sum等聚合函数
- having
- select
- distinct
- order by
- limit
以上每个步骤都会产生一个虚拟表,该虚拟表被用作下一个步骤的输入。这些虚拟表对调用者(客户端应 用程序或者外部查询)不可用。只有最后一步生成的表才会会给调用者。如果没有在查询中指定某一个子句, 将跳过相应的步骤。
从中可以总结发现:
- 第一步:肯定从FROM开始,对 FROM 子句中的前两个表(有可能有多个表)执行笛卡尔积(交叉联接),生成虚拟表 VT1。
- 第二步:对 VT1 应用 ON 筛选器,只有那些使为真才被插入到 TV2。
- 第三步:如果指定了 OUTER JOIN,这一步就是添加外部行。保留表中未找到 匹配的行将作为外部行添加到 VT2,生成 TV3。
如果 FROM 子句包含两个以上的表,则对上一个联接生成的 结果表和下一个表重复执行步骤 1 到步骤 3,直到处理完所有的表位置。
- 第四步:对 TV3 应用 WHERE 筛选器,只有使为 true 的行才插入 TV4。
在这有个比较重要的细节不得不说一下,对于包含outer join子句的查询,就有一个让人感到困惑的问题,到底在on筛选器还是用where筛选器指定逻辑表达式呢?on和where的最大区别在于,如果在on应用逻辑表达式那么在第三步outer join中还可以把移除的行再次添加回来,而where的移除的最终的。举个简单的例子,有一个学生表(班级,姓名)和一个成绩表(姓名,成绩),我现在需要返回一个x班级的全体同学的成绩,但是这个班级有几个学生缺考,也就是说在成绩表中没有记录。为了得到我们预期的结果我们就需要在on子句指定学生和成绩表的关系(学生.姓名=成绩.姓名)那么我们是否发现在执行第二步的时候,对于没有参加考试的学生记录就不会出现在vt2中,因为他们被on的逻辑表达式过滤掉了,但是我们用left outer join就可以把左表(学生)中没有参加考试的学生找回来,因为我们想返回的是x班级的所有学生,如果在on中应用学生.班级='x’的话,left outer join会把x班级的所有学生记录找回(感谢网友康钦谋__康钦苗的指正),所以只能在where筛选器中应用学生.班级=‘x’ 因为它的过滤是最终的。
-
第五步:按 GROUP BY 子句中的列列表对 TV4 中的行进行分组,生成 TV5。 如果应用了group by,那么后面的所有步骤都只能得到的vt5的列或者是聚合函数(count、sum、avg等)。原因在于最终的结果集中只为每个组包含一行。这一点请牢记。
-
第六步:应用cube或者rollup选项,为vt5生成超组,生成vt6.
-
第七步:对 VT6 应用 HAVING 筛选器,只有使为 true 的组插入到 VT7。having筛选器是第一个也是为唯一一个应用到已分组数据的筛选器。
-
第八步:处理select子句。将vt7中的在select中出现的列筛选出来。生成vt8.
-
第九步:应用distinct子句,将重复的行从 VT8 中删除,产生VT9。
-
第十步:应用order by子句。按照order_by_condition排序vt9,此时返回的一个游标,而不是虚拟表。sql是基于集合的理论的,集合不会预先对他的行排序,它只是成员的逻辑集合,成员的顺序是无关紧要的。对表进行排序的查询可以返回一个对象,这个对象包含特定的物理顺序的逻辑组织。这个对象就叫游标。正因为返回值是游标,那么使用order by 子句查询不能应用于表表达式。排序是很需要成本的,除非你必须要排序,否则最好不要指定order by,最后,在这一步中是第一个也是唯一一个可以使用select列表中别名的步骤。
-
第十一步:应用top选项。此时才返回结果给请求者即用户。
一般要注意的点: sql的书写顺序
where > group by > having > order by