一步一步优化SQL语句(一):逻辑查询的各个阶段

大家好,我是忆然,前段时间我在学习ItZik Ben-Gan、Lubor Kollar、Dejan Sarka所著的《Sql Server

2005 技术内幕:T-SQL查询》一书,在此我把一些学习的心得跟大家分享

在查询中逻辑查询和物理查询有着本质的区别,SQL不同于其它编程的最明显的特征就是处理代码的顺序,

虽然总是最先写SELECT 但是几乎总在最后执行,那到底是怎么一个执行顺序呢

作者给出了如下的sql查询语句执行顺序

(8) select (9) distinct (11) <top_specification> <select_list>

(1)from <left_table>

(3) <join_type> join <right_table>

(2) on <join _condition>

(4) where <where_condition>

(5)group by <group_by_list>

(6) with {cube|rollup}

(7)having(having_condition)

(10) order by <order_by_condition>

从这个顺序中我们不难发现,所有的 查询语句都是从from开始执行的,在执行过程中,每个步骤都会为

下一个步骤生成一个虚拟表,这个虚拟表将作为下一个执行步骤的输入。

 

第一步:首先对from子句中的前两个表执行一个笛卡尔乘积,此时生成虚拟表 vt1

第二步:接下来便是应用on筛选器,on 中的逻辑表达式将应用到 vt1 中的各个行,筛选出满足on逻辑表

达式的行,生成虚拟表 vt2

第三步:如果是outer join 那么这一步就将添加外部行,left outer jion 就把左表在第二步中过滤的添

加进来,如果是right outer join 那么就将右表在第二步中过滤掉的行添加进来,这样生成虚拟表 vt3

第四步:如果 from 子句中的表数目多余两个表,那么就将vt3和第三个表连接从而计算笛卡尔乘积,生成虚拟表,该

过程就是一个重复1-3的步骤,最终得到一个新的虚拟表 vt3

第五步:应用where筛选器,对上一步生产的虚拟表引用where筛选器,生成虚拟表vt4,在这有个比较重要

的细节不得不说一下,对于包含outer join子句的查询,就有一个让人感到困惑的问题,到底在on筛选器

还是用where筛选器指定逻辑表达式呢?on和where的最大区别在于,如果在on应用逻辑表达式那么在第三

步outer join中还可以把移除的行再次添加回来,而where的移除的最终的。举个简单的例子,有一个学生

表(班级,姓名)和一个成绩表(姓名,成绩),我现在需要返回一个x班级的全体同学的成绩,但是这个班级

有几个学生缺考,也就是说在成绩表中没有记录。为了得到我们预期的结果我们就需要在on子句指定学生

和成绩表的关系(学生.姓名=成绩.姓名)那么我们是否发现在执行第二步的时候,对于没有参加考试的学

生记录就不会出现在vt2中,因为他们被on的逻辑表达式过滤掉了,但是我们用left outer join就可以把左表(

学生)中没有参加考试的学生找回来,因为我们想返回的是x班级的所有学生,如果在on中应用学生.班级

='x'的话,那么在left outer join 中就会将不会把x班级的学生的所有记录找回来,所以只能在where筛选器中应用

学生.班级='x' 应为它的过滤是最终的。

第六步:group by 子句将<group_by_condition>中的唯一的值组合成为一组,得到虚拟表vt5。如果应用

了group by,那么后面的所有步骤都只能得到的vt5的列或者是聚合函数(count、sum、avg等)。原因在

于最终的结果集中只为每个组包含一行。这一点请牢记。

第七步:应用cube或者rollup选项,为vt5生成超组,生成vt6.

第八步:应用having筛选器,生成vt7。having筛选器是第一个也是为唯一一个应用到已分组数据的筛选器

第九步:处理select列表。将vt7中的在select中出现的列筛选出来。生成vt8.

第十步:应用distinct子句,vt8中移除相同的行,生成vt9。事实上如果应用了group by子句那么

distinct是多余的,原因同样在于,分组的时候是将列中唯一的值分成一组,同时只为每一组返回一行记

录,那么所以的记录都将是不相同的。

第十一步:应用order by子句。按照order_by_condition排序vt9,此时返回的一个游标,而不是虚拟表。

sql是基于集合的理论的,集合不会预先对他的行排序,它只是成员的逻辑集合,成员的顺序是无关紧要的

。对表进行排序的查询可以返回一个对象,这个对象包含特定的物理顺序的逻辑组织。这个对象就叫游标

。正因为返回值是游标,那么使用order by 子句查询不能应用于表表达式。排序是很需要成本的,除非你

必须要排序,否则最好不要指定order by,最后,在这一步中是第一个也是唯一一个可以使用select列表

中别名的步骤。

第十二步:应用top选项。此时才返回结果给请求者即用户。

到此为止我们将一个sql查询语句的逻辑执行过程梳理了一遍,对于使用查询语句多年的我来说,无疑对以

前的不少问题得出了解答。希望你也能从中受益。我将在后面介绍sqlserver 2005中新加入的逻辑处理阶

段。

4inwork
关注 - 1
粉丝 - 1
0
0
(请您对文章做出评价)
« 上一篇:event在浏览器中的异同与解放方案
» 下一篇:一步一步优化SQL语句(二):物理查询处理
posted @ 2009-04-26 01:44 4inwork 阅读(2387) 评论(13) 编辑 收藏 所属分类: sql

 回复 引用 查看   
#1楼2009-04-26 01:57 | 周强      
这本书的第三章是个坎,要领悟这一章稍稍有点难度,希望楼主读到这一章的时候不要动摇学习的信心。
 回复 引用 查看   
#2楼[楼主]2009-04-26 09:11 | 4inwork      
@周强
呵呵,这本书已经读完了,感谢你的提醒

 回复 引用 查看   
#3楼2009-04-26 09:12 | Cheney Shue      
我有个疑问,这样的查询:
select *
from tab1, tab2
where tab1.id = tab2.id and tab1.col1 = 123 and tab2.col1 = 'abc'
照你所述的执行顺序,先要tab1和tab2进行笛卡尔乘积,再按照tab1.col1 = 123 and tab2.col1 = 'abc'进行筛选。这样的话,效率岂不是很低,数据库有这么愚蠢吗?
使用SQL作为查询语句的数据库很多,每种数据库的编译器和优化器有不同的做法,所谓的执行顺序不能一概而论。

 回复 引用   
#4楼2009-04-26 09:13 | Microle[未注册用户]
太好了。。。关注楼主下一篇
 回复 引用 查看   
#5楼2009-04-26 10:06 | 私家侦探      
@Cheney Shue
有道理,骗人的

 回复 引用   
#6楼2009-04-26 11:25 | china-art-discount.com
学习一下,目前正在学习种…………
 回复 引用 查看   
#7楼2009-04-26 12:54 | stg609      
很少看见把执行步骤写这么详细的。谢谢~~
 回复 引用 查看   
#8楼2009-04-26 13:15 | 风吹柳絮非      
--引用--------------------------------------------------
Cheney Shue: 我有个疑问,这样的查询:
select *
from tab1, tab2
where tab1.id = tab2.id and tab1.col1 = 123 and tab2.col1 = 'abc'
照你所述的执行顺序,先要tab1和tab2进行笛卡尔乘积,再按照tab1.col1 = 123 and tab2.col1 = 'abc'进行筛选。这样的话,效率岂不是很低,数据库有这么愚蠢吗?
使用SQL作为查询语句的数据库很多,每种数据库的编译器和优化器有不同的做法,所谓的执行顺序不能一概而论。
--------------------------------------------------------
同样的疑问???

 回复 引用 查看   
#9楼2009-04-26 14:24 | Cheney Shue      
@私家侦探
也不能这么说,他这里说的是Sql Server 2005,也许这种数据库的编译器就是这么的简单。

 回复 引用 查看   
#10楼2009-04-26 15:49 | 周强      
--引用--------------------------------------------------
Cheney Shue: 我有个疑问,这样的查询:
select *
from tab1, tab2
where tab1.id = tab2.id and tab1.col1 = 123 and tab2.col1 = 'abc'
照你所述的执行顺序,先要tab1和tab2进行笛卡尔乘积,再按照tab1.col1 = 123 and tab2.col1 = 'abc'进行筛选。这样的话,效率岂不是很低,数据库有这么愚蠢吗?
使用SQL作为查询语句的数据库很多,每种数据库的编译器和优化器有不同的做法,所谓的执行顺序不能一概而论。
--------------------------------------------------------

等吧,如果楼主继续写下去,他的下一篇文章“物理查询处理过程”应该可以解决你的疑问。

 回复 引用 查看   
#11楼[楼主]2009-04-27 08:59 | 4inwork      
@Cheney Shue
Cheney Shue的两个问题提得很好,首先要说明的是这篇文章争对是sql server 2005,对于第二个疑问,的确在sql server 2005中的顺序是先进行筛选然后再做笛卡尔积。但是为什么,这篇文章所说的是先乘积在做where筛选呢?那是因为读者并没有把逻辑查询和物理查询区分开来。所谓的逻辑查询就是为了得到最终正确的结果而从理论上的一个查询顺序,往往逻辑查询和物理查询存在着很大的差异,因为物理查询的编译期的第三个阶段就是要对查询进行优化从而生成执行计划。这个优化就是在保证最终得到的结果正确(即和逻辑查询分析出来的结果一致)的情况下寻求一种效率最高的查询,当然在这个过程中就会对某些顺序做一个调整。where便是调整的其中之一。关于物理查询我会在后面的文章中做详细介绍。

 回复 引用 查看   
#12楼2009-04-28 17:00 | GeorgeHuang      
学习了,对实际操作应该会有帮助。
 回复 引用 查看   
#13楼2010-01-12 00:27 | heoo      
正在读这本书,逻辑查询处理阶段的介绍对我理清思路很有帮助!