9、《怎么给字符串加索引》

11 | 怎么给字符串字段加索引?

 
前言
 
        现在,几乎所有的系统都支持邮箱登录,如何在邮箱这样的字段上建立合理的索引,是我们今天要讨论的问题。
 
 
一、怎么给字符串加索引
 
 
    1、邮箱表
 
        假设,你现在维护一个支持邮箱登录的系统,用户表是这么定义的:
mysql> create table SUser(
ID bigint unsigned primary key,
email varchar(64),
...
)engine=innodb;
        
        由于要使用邮箱登录,所以业务代码中一定会出现类似于这样的语句:
    mysql> select * from SUser where email='xxx';
 
        从第 4 篇(4、《索引》)讲解索引的文章中,我们可以知道,如果 email 这个字段上没有索引,那么这个语句就只能做全表扫描。
        同时,MySQL 是支持前缀索引的,也就是说,你可以定义字符串的一部分作为索引。默认地,如果你创建索引的语句不指定前缀长度,那么索引就会包含整个字符串。
 
        比如,这两个在 email 字段上创建索引的语句:
mysql> alter table SUser add index index1(email);
mysql> alter table SUser add index index2(email(6));
        第一个语句创建的 index1 索引里面,包含了每个记录的整个字符串;而第二个语句创建的 index2 索引里面,对于每个记录都是只取前 6 个字节。
        那么,这两种不同的定义在数据结构和存储上有什么区别呢?如图 2 和 3 所示,就是这两个索引的示意图。
        
                                                    图 1 email 索引结构
        
                                        图 2 email(6) 索引结构
 
        从图中你可以看到,由于 email(6) 这个索引结构中每个邮箱字段都只取前 6 个字节(即:zhangs),所以占用的空间会更小,这就是使用前缀索引的优势。但,这同时带来的损失是,可能会增加额外的记录扫描次数。
        接下来,我们再看看下面这个语句,在这两个索引定义下分别是怎么执行的。
        select id,name,email from SUser where email='zhangssxyz@xxx.com';
 
        如果使用的是 index1(即 email 整个字符串的索引结构),执行顺序是这样的:
  • 从 index1 索引树找到满足索引值是’zhangssxyz@xxx.com’的这条记录,取得 ID2 的值;
  • 到主键上查到主键值是 ID2 的行,判断 email 的值是正确的,将这行记录加入结果集;
  • 取 index1 索引树上刚刚查到的位置的下一条记录,发现已经不满足 email='zhangssxyz@xxx.com’的条件了,循环结束。
        这个过程中,只需要回主键索引取一次数据,所以系统认为只扫描了一行。
 
        如果使用的是 index2(即 email(6) 索引结构),执行顺序是这样的:
  • 从 index2 索引树找到满足索引值是’zhangs’的记录,找到的第一个是 ID1;
  • 到主键上查到主键值是 ID1 的行,判断出 email 的值不是’zhangssxyz@xxx.com’,这行记录丢弃;
  • 取 index2 上刚刚查到的位置的下一条记录,发现仍然是’zhangs’,取出 ID2,再到 ID 索引上取整行然后判断,这次值对了,将这行记录加入结果集;
  • 重复上一步,直到在 idxe2 上取到的值不是’zhangs’时,循环结束。在这个过程中,要回主键索引取 4 次数据,也就是扫描了 4 行。
 
        通过这个对比,你很容易就可以发现,使用前缀索引后,可能会导致查询语句读数据的次数变多。
        但是,对于这个查询语句来说,如果你定义的 index2 不是 email(6) 而是 email(7),也就是说取 email 字段的前 7 个字节来构建索引的话,即满足前缀’zhangss’的记录只有一个,也能够直接查到 ID2,只扫描一行就结束了。
        也就是说使用前缀索引,定义好长度,就可以做到既节省空间,又不用额外增加太多的查询成本。
 
        于是,你就有个问题:当要给字符串创建前缀索引时,有什么方法能够确定我应该使用多长的前缀呢?答案是:区分度!
        实际上,我们在建立索引时关注的是区分度,区分度越高越好。因为区分度越高,意味着重复的键值越少。因此,我们可以通过统计索引上有多少个不同的值来判断要使用多长的前缀。
        首先,你可以使用下面这个语句,算出这个列上有多少个不同的值:
        mysql> select count(distinct email) as L from SUser;
        然后,依次选取不同长度的前缀来看这个值,比如我们要看一下 4~7 个字节的前缀索引,可以用这个语句:
mysql> select
  count(distinct left(email,4))as L4,
  count(distinct left(email,5))as L5,
  count(distinct left(email,6))as L6,
  count(distinct left(email,7))as L7,
from SUser;
        当然,使用前缀索引很可能会损失区分度,所以你需要预先设定一个可以接受的损失比例,比如 5%。然后,在返回的 L4~L7 中,找出不小于 L * 95% 的值,假设这里 L6、L7 都满足,你就可以选择前缀长度为 6。
 
 
 
二、前缀索引对覆盖索引的影响
 
        前面我们说了使用前缀索引可能会增加扫描行数,这会影响到性能。其实,前缀索引的影响不止如此,我们再看一下另外一个场景。
 
        select id,email from SUser where email='zhangssxyz@xxx.com';
        这个语句只要求返回 id 和 email 字段。所以,
        如果使用 index1(即 email 整个字符串的索引结构)的话,可以利用覆盖索引,从 index1 查到结果后直接就返回了,不需要回到 ID 索引再去查一次。
        而如果使用 index2(即 email(6) 索引结构)的话,就不得不回到 ID 索引再去判断 email 字段的值。即使你将 index2 的定义修改为 email(18) 的前缀索引,这时候虽然 index2 已经包含了所有的信息,但 InnoDB 还是要回到 id 索引再查一下,因为系统并不确定前缀索引的定义是否截断了完整信息。
        也就是说,使用前缀索引就用不上覆盖索引对查询性能的优化了,这也是你在选择是否使用前缀索引时需要考虑的一个因素。
 
 
 
 
三、小结
 
        在今天这篇文章中,我跟你聊了聊字符串字段创建索引的场景。我们来回顾一下,你可以使用的方式有:
  • 1、直接创建完整索引,这样可能比较占用空间;
  • 2、创建前缀索引,节省空间,但会增加查询扫描次数,并且不能使用覆盖索引;
  • 3、倒序存储,再创建前缀索引,用于绕过字符串本身前缀的区分度不够的问题不支持范围扫描;
  • 4、创建 hash 字段索引,查询性能稳定,有额外的存储和计算消耗,不支持范围扫描。
 
 
 
 
 
 
 
 
 
 
 
 
 

posted on 2022-09-20 15:33  夏天的风49  阅读(11)  评论(0)    收藏  举报

导航