Mysql面试题分享十：为什么索引要用B＋树来实现呢，而不是B树？

之乎者也·

已于 2023-11-25 23:34:55 修改

阅读量122

点赞数

分类专栏： Mysql 面试题分享文章标签： mysql b树数据库

于 2023-11-15 20:00:45 首次发布

本文链接：https://blog.csdn.net/qq_45038038/article/details/134427895

版权

Mysql 面试题分享专栏收录该内容

77 篇文章 8 订阅

订阅专栏

一、索引是什么？

相信你在面试时，通常会被问到“什么是索引？”而你一定要能脱口而出：索引是提升查询速度的一种数据结构。

索引之所以能提升查询速度，在于它在插入时对数据进行了排序（显而易见，它的缺点是影响插入或者更新的性能）。

所以，索引是一门排序的艺术，有效地设计并创建索引，会提升数据库系统的整体性能。在目前的 MySQL 8.0 版本中，InnoDB 存储引擎支持的索引有 B+ 树索引、全文索引、R 树索引。这一讲我们就先关注使用最为广泛的 B+ 树索引。

二、各种数据结构的对比

数据库索引的数据结构有很多种，比如：哈希索引、平衡二叉树索引、B树索引、B+树索引等等。

目前最流行的是B+树索引，那大家有没有想过为什么是B+树索引最流行，为什么其他索引应用不广泛。

就像为什么别人能拿2-3万的工资，我却只能拿一万的工资，大家有思考过吗？

哈希索引

hash大家应该非常的熟悉，就是我们老生常谈的HashMap里用到的技术。Hash索引其检索效率非常高，索引的检索可以一次定位。

可能很多人又有疑问了，既然Hash索引的效率这么高，为什么都用Hash索引而还要使用B-Tree索引呢?

任何事物都是有两面性的，Hash索引也一样，虽然Hash索引效率高，但是Hash索引本身由于其特殊性也带来了很多限制和弊端，主要有以下这些：

原因一：

Hash索引不能使用范围查询

Hash索引仅仅能满足"=","IN"和"<=>"查询(注意<>和＜＝＞是不同的操作），不能使用范围查询，例如WHERE price > 100。

由于Hash索引比较的是进行Hash运算之后的Hash值，所以它只能用于等值的过滤，不能用于基于范围的过滤。

原因二：

Hash索引不能利用部分索引键查询。

对于复合索引，Hash索引在计算Hash值的时候，是组合索引键合并后再一起计算Hash值，而不是单独计算Hash值。

所以通过复合索引的前面一个或几个索引键进行查询的时候，Hash索引也无法被利用。

原因三：

Hash索引在任何时候都不能避免表扫描。

Hash索引是将索引键通过Hash运算之后，将 Hash运算结果的Hash值和所对应的行指针信息存放于一个Hash表中。

由于不同索引键存在相同Hash值，所以无法从Hash索引中直接完成查询，还是要通过访问表中的实际数据进行相应的比较，并得到相应的结果。

hash索引out出局

平衡二叉树索引

又称 AVL树。它除了具备二叉查找树的基本特征之外，还具有一个非常重要的特点：它的左子树和右子树都是平衡二叉树。

且左子树和右子树的深度之差的绝对值（平衡因子）不超过1。也就是说AVL树每个节点的平衡因子只可能是-1、0和1（左子树高度减去右子树高度）。

被淘汰的原因

树的高度过高，高度越高，查找速度越慢
他支持范围查找，但是他需要在进行回旋查找

比如我要找到大于5的数据

第一步我先定位到5，然后在树上按照二叉树规则去回旋查找大于5其他数据6、7、8、9、10。。。

如果大于5的数据很多，那速度是很慢的。

B树索引

大家可以看到B树和二叉树最大的区别在于：它一个节点可以存储两个值，这就意味着它的树高度，比二叉树的高度更低，它的查询速度就更快。这是他的优点

那为什么最终还是不用它呢，还是因为他在范围查找的时候，存在回旋查询的问题。同样order by排序的时候效率也很低，因为要把树上的数据手动排序一遍。

B+树

它是B数的升级版，B+树相比B树，新增叶子节点与非叶子节点关系。

叶子节点中包含了key和value，key存储的是1-10这些数字，value存储的是数据存储地址，非叶子节点中只是包含了key，不包含value。

所有相邻的叶子节点包含非叶子节点，使用链表进行结合，有一定顺序排序，从而范围查询效率非常高。

比如我们要查找大于5的数据：

首先我们定位到5的位置
然后直接将5后面的数据全部拿出来即可，因为这是有序链表，已经排好序了

我们在order by排序的时候为什么要使用索引进行排序，原因就在这。

三、为什么使用B+树

1、B树只适合随机检索，而B+树同时支持随机检索和顺序检索;
2、B+树空间利用率更高

因为B+树的内部节点（非叶子节点，也称索引节点）不存储数据，只存储索引值，相比较B树来说，B+树一个节点可存储更多的索引值，使得整颗B+树变得更矮，减少I/O次数，磁盘读写代价更低，I/O读写次数是影响索引检索效率的最大因素;
3、B+树查询效率更加稳定

因为在B+树中，顺序检索比较明显，随机检索时，由于B+树所有的 data 域（结点中存储数据元素的部分）都在根节点，任何关键字的查找都必须走一条从根节点到叶节点的路，所有关键字的查找路径相同，导致每一个关键字的查询效率基本相同，时间复杂度固定为 O(log n)；而B树搜索有可能会在非叶子节点结束，约靠近根节点的记录查找时间越短，其性能等价于在关键字全集内做一次二分查找，查询时间复杂度不固定，与 key 在树中的位置有关，最好情况为O(1)；
4、 B+树范围查询性能更优

因为B+树的叶子节点使用了指针顺序（链表）从小到大地连接在一起，B+树叶节点两两相连可大大增加区间访问性，只要遍历叶子节点就可以实现整棵树的遍历，而B树的叶子节点是相互独立的，每个节点 key（索引）和 data 在一起，则无法查找区间；

【根据空间局部性原理：如果一个存储器的某个位置被访问，那么将它附近的位置也会被访问】

若访问节点 key为 50，则 key 为 55、60、62 的节点将来也可能被访问，可利用磁盘预读原理提前将这些数据读入内存，减少了磁盘 IO 的次数。当然B+树也能够很好的完成范围查询，比如同时也会查询 key 值在 50-70 之间的节点。

5、B+树增删文件（节点）时，效率更高

因为B+树的叶子节点包含了所有关键字，并以有序的链表结构存储。

说明：InnoDB的一棵B+树可以存放多少行数据？约2千万。

之乎者也·

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
打赏
0
评论
Mysql面试题分享十：为什么索引要用B＋树来实现呢，而不是B树？

相信你在面试时，通常会被问到“什么是索引？。索引之所以能提升查询速度，在于它在插入时对数据进行了排序（显而易见，它的缺点是影响插入或者更新的性能）。所以，索引是一门排序的艺术，有效地设计并创建索引，会提升数据库系统的整体性能。在目前的 MySQL 8.0 版本中，InnoDB 存储引擎支持的索引有 B+ 树索引、全文索引、R 树索引。。
复制链接

扫一扫