通过手动创建统计信息优化sql查询性能案例

本质原因在于：SQL Server 统计信息只包含复合索引的第一个列的信息，而不包含复合索引数据组合的信息

来源于工作中的一个实际问题，

这里是组合列数据不均匀导致查询无法预估数据行数，从而导致无法选择合理的执行计划导致性能低下的情况

我这里把问题简单化，主要是为了说明问题

如下一张业务表，主要看两个“状态”字段，BusinessStatus1 和 BusinessStatus2

create table BusinessTable

(

    Id int identity(1,1),

    Col2 varchar(50),

    Col3 varchar(50),

    Col4 varchar(50),

    BusinessStatus1 tinyint,

    BusinessStatus2 tinyint,

    CreateDate Datetime

)

GO

--向测试表中写入数据：

begin tran

    declare @i int

    set @i=0

    while @i<500000

    begin

        insert into BusinessTable values (NEWID(),NEWID(),NEWID(),1,10,GETDATE()-RAND()*1000)

        insert into BusinessTable values (NEWID(),NEWID(),NEWID(),1,20,GETDATE()-RAND()*1000)

        insert into BusinessTable values (NEWID(),NEWID(),NEWID(),1,30,GETDATE()-RAND()*1000)

        insert into BusinessTable values (NEWID(),NEWID(),NEWID(),2,20,GETDATE()-RAND()*1000)

        insert into BusinessTable values (NEWID(),NEWID(),NEWID(),2,30,GETDATE()-RAND()*1000)

        insert into BusinessTable values (NEWID(),NEWID(),NEWID(),2,40,GETDATE()-RAND()*1000)

        insert into BusinessTable values (NEWID(),NEWID(),NEWID(),3,30,GETDATE()-RAND()*1000)

        insert into BusinessTable values (NEWID(),NEWID(),NEWID(),3,40,GETDATE()-RAND()*1000)

        insert into BusinessTable values (NEWID(),NEWID(),NEWID(),3,50,GETDATE()-RAND()*1000)

        set @i=@i+1

    end

commit

--插入一条特殊数据，也就是实际业务场景中：

insert into BusinessTable values (NEWID(),NEWID(),NEWID(),3,10,GETDATE()-RAND()*1000)

--测试数据的特点是：

--BusinessStatus1 的分布位：1，2,3,

--BusinessStatus2 的分布位：10，20,30,40,50

--目前数据的对应关系，

--但是注意插入的一条特殊数据：

--BusinessStatus1 和 BusinessStatus2 的组合为：BusinessStatus1=3 and BusinessStatus2=10，在451W条数据中是唯一的一个组合

--创建如下索引：

Create Clustered index idx_createDate on BusinessTable(CreateDate)

Create Index idx_status on BusinessTable(BusinessStatus1,BusinessStatus2)

进行如下查询，就是查询那条所谓的特殊数据

select *

from BusinessTable

where BusinessStatus1=3 and BusinessStatus2=10

发现执行计划如下:走的是全表扫描，IO代价也不小，

这种情况下，明明只有一条数据，却要走全表扫描

（实际业务中类似数据也不仅只有一条这么巧，但是在千万级的表中，符合类似条件的数据很少，

打个比方好理解一点，就像订单表一样，订单是退订状态，且尚未退款，这种数据的分布是少之又少吧

只是举例，不要较真）

上面查询的IO信息

再通过强制索引提示的情况下，发现同样的查询，IO有一个非常大的下降

分析上述sql为什么不走索引？因为毕竟符合条件的数据只有一条，走全表扫描代价也过于大了，尤其是实际情况中，业务表更大，逻辑也没有这么直白

这个还要从索引统计信息说起，在符合索引中，索引统计信息只是统计前导列的，对于组合列的分布，sqlserver是无法预估到的，这一点可以通过第一个查询的执行计划发现

sqlserver只是能够预估到 BusinessStatus1 =3 的情况下的数据分布，但是无法预估到 BusinessStatus1=3 and BusinessStatus2=10这个组合情况下的数据分布情况

当然通过统计信息也可以看到，统计信息只记录了BusinessStatus1的列的数据分布情况，但是实际执行的过程中，无法预估BusinessStatus1=3 and BusinessStatus2=10的准确分布

找到了问题的原因，就容易解决了，既然sqlserver无法预估到BusinessStatus1=3 and BusinessStatus2=10这个组合条件的数据分布请，

那么就创建一个过滤统计信息，让sqlserver准确地知道这个条件下数据的分布请，就容易做出相对准确的执行计划了

通过如下语句，创建一个该条件的统计信息

create statistics BusinessTableFilterStatistics

on BusinessTable(BusinessStatus1,BusinessStatus2)

where BusinessStatus1=3 and BusinessStatus2=10

--创建完统计信息之后注意要做个更新

UPDATE STATISTICS BusinessTable BusinessTableFilterStatistics with fullscan

创建完统计信息之后，发现表上会增加一个刚刚创建的统计信息

现在再来看这个查询的执行计划情况，发现其按照预期的走了索引

同时观察起IO情况，也有一个大幅度的下降

总结：

以上通过手动创建统计信息，来促使sqlserver在生成执行计划的时候，准确地知道数据的分布情况，做出较为优化的执行计划，在某些特殊的情况下，可以作为优化的一个考虑方向

后记：

或许有人认为这个问题该归结于parameter sniff的问题，其实这个问题跟parameter sniff还不太一样（当然也有一点像）

通常情况下，所说的parameter sniff问题是单列数据分布不均匀的情况下，因为执行计划重用导致性能地下的一个现象，重点是执行计划的不合理重用

这里的问题在于，由于统计信息的数据计算方式，sqlserver 压根无法预估到符合条件数据的准确分布，从而无法做出合理的执行计划的情况

当然这种情况也比较特殊，在强制索引提示以外，可以通过手动创建统计信息来达到优化的目的

通过手动创建统计信息优化sql查询性能案例的更多相关文章

SQL常见优化Sql查询性能的方法有哪些？
常见优化Sql查询性能的方法有哪些? 1.查询条件减少使用函数,避免全表扫描 2.减少不必要的表连接 3.有些数据操作的业务逻辑可以放到应用层进行实现 4.可以使用with as 5.使用“临时表”暂 ...
优化SQL 查询性能
为什么查询会很慢如果把查询看作是一个任务,那么它由一系列子任务组成,每个子任务都会消耗一定的时间.要优化查询,实际上是要优化其子任务,要么消除其中一些子任务,要么减少子任务的执行次数,要么让子任务运 ...
转载：性能优化——统计信息——SQLServer自动更新和自动创建统计信息选项
这段时间AX查询变得非常慢,每天都有很多锁. 最后发现是数据库统计信息需要更新. ----------------------------------------------------------- ...
性能优化——统计信息——SQLServer自动更新和自动创建统计信息选项
原文:性能优化--统计信息--SQLServer自动更新和自动创建统计信息选项原文译自:http://www.mssqltips.com/sqlservertip/2766/sql-server-a ...
Oracle 手动收集统计信息
收集oracle统计信息优化器统计范围: 表统计: --行数,块数,行平均长度:all_tables:NUM_ROWS,BLOCKS,AVG_ROW_LEN: 列统计: --列中唯一值的数量(NDV ...
Oracle 判断并手动收集统计信息脚本
CREATE OR REPLACE PROCEDURE SchameB.PRC_GATHER_STATS AUTHID CURRENT_USER IS BEGIN SYS.DBMS_STATS.GAT ...
SQL查询性能分析
http://blog.csdn.net/dba_huangzj/article/details/8300784 SQL查询性能的好坏直接影响到整个数据库的价值,对此,必须郑重对待. SQL Serv ...
Mysql sql查询性能侦查
Mysql 服务性能优化配置:http://5434718.blog.51cto.com/5424718/1207526[该文章很好] Sql查询性能优化对Sql进行优化,肯定是该Sql运行未能达到 ...
SQL Server-聚焦sp_executesql执行动态SQL查询性能真的比exec好？
前言之前我们已经讨论过动态SQL查询呢?这里为何再来探讨一番呢?因为其中还是存在一定问题,如标题所言,很多面试题也好或者有些博客也好都在说在执行动态SQL查询时sp_executesql的性能比ex ...

随机推荐

spring的代理模式
静态代理: 首先定义一个接口,随便写一个方法定义2个实现接口的方法 (被代理的对象) (代理对象) 需要将接口定义get set 方法代理增强的方法然后实现输出结果如下: 动态代理(jdk动 ...
关于Delphi错误：Cannot make a visible window modal
Delphi的fsMDIChild类型的窗体是不能使用ShowModal的,否则会弹出"Cannot make a visible window modal"异常, 但是把fsMD ...
FizzBuzzWhizz游戏的高效解法
最近比较火的一道题(传送门),看见园友们的谈论(传送门1 传送门2),都是从1到100的扫描,我想说说的另一种想法. 可以把这道题转换成给100个人发纸牌的游戏,每人所报的就是纸牌上写的东西. 纸牌发 ...
java线程学习
线程概念当我问别人什么是线程的时候,别人给我讲了一大堆线程如何创建,如何使用以及若干线程的高深问题,其实作为一个资深菜鸟,我就想问问,什么是线程而已,找了书中的一些概念总结了一下,多线程与操作系统中 ...
领域驱动设计（DDD）部分核心概念的个人理解
领域驱动设计(DDD)是一种基于模型驱动的软件设计方式.它以领域为核心,分析领域中的问题,通过建立一个领域模型来有效的解决领域中的核心的复杂问题.Eric Ivans为领域驱动设计提出了大量的最佳实践 ...
C#之委托与事件
委托与事件废话一堆:网上关于委托.事件的文章有很多,一千个哈姆雷特就有一千个莎士比亚,以下内容均是本人个人见解. 1. 委托 1.1 委托的使用这一小章来学习一下怎么简单的使用委托,了解一些基本的 ...
Modern OpenGL用Shader拾取VBO内单一图元的思路和实现(2)
Modern OpenGL用Shader拾取VBO内单一图元的思路和实现(2) 上一篇里介绍了Color-Coded Picking的思路和最基本的实现.在处理GL_POINTS时已经没有问题,但是处 ...
Azure PowerShell (4) 使用PowerShell管理多个订阅
<Windows Azure Platform 系列文章目录> 笔者手上有两个Azure账户. - Azure Global (windowsazure.com)账户.有两个订阅. - 世 ...
Dynamics CRM导出数据到Excel
原创地址:http://www.cnblogs.com/jfzhu/p/4276212.html 转载请注明出处 Pivot Table是微软BI的一个重要工具,所以这里讲一下Dynamics CRM ...
hibernate用注解替代映射文件
1.首先把原来的映射文件删掉,给实体类添加注解: @Entity //声明当前类为hibernate映射到数据库中的实体类 @Table(name="news") //声明tabl ...

通过手动创建统计信息优化sql查询性能案例

通过手动创建统计信息优化sql查询性能案例的更多相关文章

随机推荐

热门专题