红黑树(上):为什么工程中都用红黑树这种二叉树?

之前,讲了二叉树,二叉查找树。二叉查找树是最常用的一种二叉树,支持快速插入、删除、查找等操作。各个操作的时间复杂度跟树的高度成正比,理想情况下,时间复杂度是O(logn)。

不过,二叉查找树在频繁的动态更新过程中,可能会出现树的高度远大于logn的情况,从而导致各个操作的效率下降。极端情况下,二叉树会退化为链表,时间复杂度会退化到O(n)。要解决这个复杂度退化的问题,我们需要设计一种平衡二叉查找树,也就是红黑树。

很多书里,只要提到了平衡二叉查找树,就会拿红黑树作为例子。不仅如此,如果有一定的开发经验,就会发现,在工程中,很多用到平衡二叉查找树的地方都会用到红黑树。

那么,为什么工程中都喜欢用红黑树,而不是其他平衡二叉查找树呢?

什么是“平衡二叉查找树”

平衡二叉树的严格定义是这样的:二叉树中任意一个节点的左右子树的高度相差不能大于1.从这个定义来看,上一节我们说的完全二叉树,满二叉树其实都是平衡二叉树,但是非完全二叉树也有可能是平衡二叉树。

在这里插入图片描述

平衡二叉差好书不仅满足上面平衡二叉树的定义,还满足二叉查找树的特点。最先被发明的平衡二叉查找树是AVL树,它严格符合我刚说的平衡二叉查找树的定义,也就是任何节点的左右子树高度相差不超过1,是一种高度平衡的二叉查找树。

但是很多平衡二叉查找树并没有严格符合上面的定义(树中任意一个节点的左右子树的高度相差不能大于1),比如我们下面要讲的红黑树,它从根节点到各个叶子节点的最长路径,有可能会比最短路径大一倍。

平衡二叉查找树中 “平衡” 的意思是:让整棵树左右看起来比较“对称”、“平衡”,不要出现左子树很高,右子树很矮的情况。这样就能让整棵树的高度相对来说低一些,相应的插入、删除、查找等操作的效率高一些。

所以,如果我们现在设计一个新的平衡二叉查找树,只要树的高度不比logn大很多,尽管它不符合我们前面讲的严格的平衡二叉查找树的定义,但我们仍然可以说,这是一个合格的平衡二叉查找树。

如何定义一棵“红黑树”?

平衡二叉查找树其实有很多,比如,Splay Tree(伸展树)、Treap(树堆)等,但是我们提到平衡二叉查找树,听到的基本都是红黑树。它的出镜率甚至要高于“平衡二叉查找树”这几个字,有时候,我们甚至默认平衡二叉查找树就是红黑树,那我们现在就来看看这个:红黑树

红黑树是一种不严格的平衡二叉查找树,前面说了,它的定义是不严格符合平衡二叉查找树的定义。那红黑树究竟是如何定义的呢?

顾名思义,红黑树中的节点,一类为黑,一类为红。除此之外,还有这样几个要求:

  1. 根节点是黑色的。
  2. 每个叶子节点都是黑色的空节点(NIL),也就是说,叶子节点不存储数据。
  3. 任何相邻的节点都不能同时为红色,也就是说,红色节点是被黑色节点隔开的。
  4. 每个节点,从该节点到达其可达叶子节点的所有路径,都包含相同数目的黑色节点。

在这里插入图片描述

为什么说红黑树是“近似平衡”的?

平衡:性能不退化
近似平衡:性能不会退化的太严重

我们要知道,平衡二叉树的初衷就是解决二叉查找树动态更新导致的性能退化问题。

因为平衡二叉树的高度是logn,为了证明红黑树的近似平衡,只要证明是否趋近于logn就行了。

我们接下来一步步推导:

首先,将红色节点去除,保留纯黑色节点的红黑树,那么高度是多少呢?

红色节点删除之后,有些节点就没有父节点了,它们会直接拿这些节点的祖父节点(父节点的父节点)作为父节点。所以,之前的二叉树就变成了四叉树。

在这里插入图片描述

前面红黑树的定义有一条说:从任意节点到可达的叶子节点的每个路径包含相同数目的黑色节点。我们从四叉树中取出某些节点,放到叶节点位置,四叉树就变成了完全二叉树。所以,仅包含黑色节点的四叉树的高度,比包含相同节点个数的完全二叉树的高度还要小。

因为完全二叉树的高度近似于logn,这里的四叉黑树的高度低于完全二叉树,所以去掉红色节点的黑树的高度也不会超过logn。

我们现在知道只包含黑色节点的黑树的高度,那我们现在把红色节点加回去,高度会变成多少呢?

从上面的红黑树的例子来说,在红黑树中,红色节点不能相邻,也就是说,有一个红色节点就要至少有一个黑色节点,将它跟其他红色节点隔开。红黑树中包含最多黑色节点的路径不会超过logn,所以加入红色节点之后,最长路径不会超过2logn,也就是说,红黑树的高度近似2logn。

所以,红黑树的高度只比高度平衡的AVL树的高度(logn)仅仅大了一倍,在性能上,下降得不多,这样推导出来的结果不够精确,实际上红黑树的性能更好。

总结

为什么工业级开发,都喜欢用红黑树这种平衡二叉查找树呢?

其实大部分平衡二叉查找树的操作效率都很高,但是无法避免极端情况下时间复杂度的退化,所以对于单词操作时间比较敏感的场景来说,不太使用。

AVL树是一种高度平衡的二叉树,所以查找的效率很高,但是有利就有弊,AVL树为了维持这种高度的平衡,就要付出更多代价。每次插入,删除都要做调整,就比较复杂、耗时,所以,对于频繁的插入、删除操作的数据集合,就会有过多的代价了。

红黑树只是做到了近似的平衡,而不是严格的平衡,所以在维护成本上,要比AVL的树要低。

所以,红黑树的插入、删除、查找各种操作的性能都比较稳定。对于工程应用来说,要面对各种异常情况,为了支撑这种工业级的应用,我们更倾向于这种性能稳定的平衡二叉查找树。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值