
# SQL查询执行流程
SQL引擎从接收SQL语句到执行SQL语句需要经历的步骤如[图1]和[表1]所示。其中，红色字体部分为DBA可以介入实施调优的环节。
图1SQL引擎执行查询类SQL语句的流程   
![](https://support.huaweicloud.com/devg-dws/figure/zh-cn_image_0000001233563355.png "点击放大")
 表1SQL引擎执行查询类SQL语句的步骤说明 
| 步骤         | 说明                                                                                                                                                                                                                                                                                               |
|:---|:---|
| 1、语法\&词法解析 | 按照约定的SQL语句规则，把输入的SQL语句从字符串转化为格式化结构(Stmt)。                                                                                                                                                                                                                                                        |
| 2、语义解析     | 将"语法\&词法解析"输出的格式化结构转化为数据库可以识别的对象。                                                                                                                                                                                                                                                                |
| 3、查询重写     | 根据规则把"语义解析"的输出等价转化为执行上更为优化的结构。                                                                                                                                                                                                                                                                   |
| 4、查询优化     | 根据"查询重写"的输出和数据库内部的统计信息规划SQL语句具体的执行方式，也就是执行计划。统计信息和GUC参数对查询优化（执行计划）的影响，请参见[调优手段之统计信息]和[调优手段之GUC参数]。 |
| 5、查询执行     | 根据"查询优化"规划的执行路径执行SQL查询语句。底层存储方式的选择合理性，将影响查询执行效率。详见[调优手段之底层存储]。                                                                                                                                    |
   
 #### 调优手段之统计信息
DWS优化器是典型的基于代价的优化 (Cost-Based Optimization，简称CBO)。在这种优化器模型下，数据库根据表的元组数、字段宽度、NULL记录比率、distinct值、MCV值、HB值等表的特征值，以及一定的代价计算模型，计算出每一个执行步骤的不同执行方式的输出元组数和执行代价（cost），进而选出整体执行代价最小/首元组返回代价最小的执行方式进行执行。这些特征值就是统计信息。从上面描述可以看出统计信息是查询优化的核心输入，准确的统计信息将帮助优化器选择最合适的查询规划，一般来说通过ANALYZE语法收集整个表或者表的若干个字段的统计信息，周期性地运行ANALYZE，或者在对表的大部分内容做了更改之后马上运行它是个好习惯。
 #### 调优手段之GUC参数
查询优化的主要目的是为查询语句选择高效的执行方式。
如下SQL语句:
```
SELECT count(1) 
FROM customer inner join store_sales on (ss_customer_sk = c_customer_sk);
```
在执行customer inner join store_sales的时候，DWS支持Nested Loop、Merge Join和Hash Join三种不同的Join方式。优化器会根据表customer和表store_sales的统计信息估算结果集的大小以及每种join方式的执行代价，然后对比选出执行代价最小的执行计划。
如前所述，执行代价估算依赖于特定模型和统计信息。当估算结果与实际执行成本存在偏差时，可通过调整GUC参数让优化器选择更优的执行计划。
 #### 调优手段之底层存储
DWS的表支持行存表、列存表，底层存储方式的选择严格依赖于客户的具体业务场景。一般来说计算型业务查询场景（以关联、聚合操作为主）建议使用列存表；点查询、大批量UPDATE/DELETE业务场景适合行存表。
对于每种存储方式还有对应的存储层优化手段，这部分会在后续的调优章节深入介绍。
#### 调优手段之SQL重写
除了上述干预SQL引擎所生成执行计划的执行性能外，根据数据库的SQL执行机制以及大量的实践发现，有些场景下，在保证客户业务SQL逻辑的前提下，通过一定规则由DBA重写SQL语句，可以大幅度的提升SQL语句的性能。
这种调优场景对DBA的要求比较高，需要对客户业务有足够的了解，同时也需要扎实的SQL语句基本功，后续会介绍几个常见的SQL改写场景。
