浅析最好、最坏、平均、均摊时间复杂度

最新推荐文章于 2022-01-07 10:23:04 发布

亦难猿

最新推荐文章于 2022-01-07 10:23:04 发布

阅读量751

点赞数 2

分类专栏：数据结构和算法文章标签：数据结构和算法

数据结构和算法专栏收录该内容

1 篇文章 0 订阅

订阅专栏

// n 表示数组 array 的长度
int find(int[] array, int n, int x) {
  int i = 0;
  int pos = -1;
  for (; i < n; ++i) {
    if (array[i] == x){
    pos = i;
    } 
  }
  return pos;
}

这是一个在无序（Array）数组中寻找X的所在位置的遍历，如果未找到则返回-1。根据之前学到的知识，我们可以看出这段程序的复杂度是O（n），因为无序等等原因，我们并不需要每次都把代码遍历完有可能在中途就寻找到，这样的代码就不算高效，所以现在我们可以把它优化下：

// n 表示数组 array 的长度
int find(int[] array, int n, int x) {
  int i = 0;
  int pos = -1;
  for (; i < n; ++i) {
    if (array[i] == x) {
       pos = i;
       break;
    }
  }
  return pos;
}

这时我们优化完了，这样的代码的复杂度还是O（n）吗？上节课的知识就不够用了。

这时我们明显可以看到，因为要查找的变量 x 可能出现在数组的任意位置。如果数组中第一个元素正好是要查找的变量 x，那就不需要继续遍历剩下的 n-1 个数据了，那时间复杂度就是 O(1)。但如果数组中不存在变量 x，那我们就需要把整个数组都遍历一遍，时间复杂度就成了 O(n)。所以，不同的情况下，这段代码的时间复杂度是不一样的。

所以引出了我们今天的内容，最好情况时间复杂度、最坏情况时间复杂度和平均情况时间复杂度。

最好情况时间复杂度：在最理想的情况下，执行这段代码的时间复杂度，就好比刚才这段代码，X刚好是这个数组遍历中的第一个，这个时候对应的时间复杂度就是最好情况时间复杂度。

最坏情况时间复杂度：在最糟糕的情况下，执行这段代码的时间复杂度。就像刚举的那个例子，如果数组中没有要查找的变量 x，我们需要把整个数组都遍历一遍才行，所以这种最糟糕情况下对应的时间复杂度就是最坏情况时间复杂度。

平均情况时间复杂度：在正常情况中最好、最坏情况时间复杂度发生属于小概率事件，为了更好的分析时间复杂度，我们需要引入另一个概念：平均情况时间复杂度，后面我简称为平均时间复杂度。

要查找的变量 x 在数组中的位置，有 n+1 种情况：在数组的 0～n-1 位置中和不在数组中。我们把每种情况下，查找需要遍历的元素个数累加起来，然后再除以 n+1，就可以得到需要遍历的元素个数的平均值，即：

在时间复杂度的大 O 标记法中，可以省略掉系数、低阶、常量，所以，咱们把刚刚这个公式简化之后，得到的平均时间复杂度就是 O(n)。

这个结论虽然是正确的，但是计算过程稍微有点儿问题。究竟是什么问题呢？我们刚讲的这 n+1 种情况，出现的概率并不是一样的。我带你具体分析一下。（这里要稍微用到一点儿概率论的知识，不过非常简单，你不用担心。）我们知道，要查找的变量 x，要么在数组里，要么就不在数组里。这两种情况对应的概率统计起来很麻烦，为了方便你理解，我们假设在数组中与不在数组中的概率都为 1/2。另外，要查找的数据出现在 0～n-1 这 n 个位置的概率也是一样的，为 1/n。所以，根据概率乘法法则，要查找的数据出现在 0～n-1 中任意位置的概率就是 1/(2n)。

因此，前面的推导过程中存在的最大问题就是，没有将各种情况发生的概率考虑进去。如果我们把每种情况发生的概率也考虑进去，那平均时间复杂度的计算过程就变成了这样：

这个值就是概率论中的加权平均值，也叫作期望值，所以平均时间复杂度的全称应该叫加权平均时间复杂度或者期望时间复杂度。

引入概率后，前面代码的加权平均值为（3n+1）/4.用大O表示法去掉系数和常量，这段代码的加权平均时间复杂度依然是O（n）。当然这是个别情况，在大多数情况下我们并不需要区分最好、最坏、平均时间复杂度这三种情况，很多时候我们使用一个复杂度就可以满足需求了，只有同一段代码在不同的情况下，时间复杂度有量级的差距，我们才会使用这三种复杂度表示法来区分。

均摊时间复杂度：

均摊时间复杂度，听起来跟平均时间复杂度有点儿像。对于初学者来说，这两个概念确实非常容易弄混。我前面说了，大部分情况下，我们并不需要区分最好、最坏、平均三种复杂度。平均复杂度只在某些特殊情况下才会用到，而均摊时间复杂度应用的场景比它更加特殊、更加有限。

// array 表示一个长度为 n 的数组
 // 代码中的 array.length 就等于 n
 int[] array = new int[n];
 int count = 0;
 
 void insert(int val) {
    if (count == array.length) {
       int sum = 0;
       for (int i = 0; i < array.length; ++i) {
          sum = sum + array[i];
       }
       array[0] = sum;
       count = 1;
    }

    array[count] = val;
    ++count;
 }

这段代码实现了一个往数组中插入数据的功能。当数组满了之后，也就是代码中的 count == array.length 时，我们用 for 循环遍历数组求和，并清空数组，将求和之后的 sum 值放到数组的第一个位置，然后再将新的数据插入。但如果数组一开始就有空闲空间，则直接将数据插入数组。

首先，find() 函数在极端情况下，复杂度才为 O(1)。但 insert() 在大部分情况下，时间复杂度都为 O(1)。只有个别情况下，复杂度才比较高，为 O(n)。这是 insert()第一个区别于 find() 的地方。

我们再来看第二个不同的地方。对于 insert() 函数来说，O(1) 时间复杂度的插入和 O(n) 时间复杂度的插入，出现的频率是非常有规律的，而且有一定的前后时序关系，一般都是一个 O(n) 插入之后，紧跟着 n-1 个 O(1) 的插入操作，循环往复。每一次 O(n) 的插入操作，都会跟着 n-1 次 O(1) 的插入操作，所以把耗时多的那次操作均摊到接下来的 n-1 次耗时少的操作上，均摊下来，这一组连续的操作的均摊时间复杂度就是 O(1)。这就是均摊分析的大致思路。

所以我们可以总结出：在对一个数据结构进行一组连续操作中，大部分情况下时间复杂度都很低，只有个别情况下时间复杂度比较高，而且这些操作之间存在前后连贯的时序关系，这个时候，我们就可以将这一组操作放在一块儿分析，看是否能将较高时间复杂度那次操作的耗时，平摊到其他那些时间复杂度比较低的操作上。而且，在能够应用均摊时间复杂度分析的场合，一般均摊时间复杂度就等于最好情况时间复杂度。

均摊时间复杂度就是一种特殊的平均时间复杂度。

总结：

最好时间复杂度：指的是代码在最理想的情况下执行的时间复杂度。

最坏时间复杂度：指的是代码在最不理想的情况下执行的时间复杂度。

平均时间复杂度：指的是代码在所有情况下执行的次数的加权平均值。

均摊时间复杂度：均摊时间复杂度一般情况下是不使用的，使用需要具备以下两个特点：

1.在大部分情况下复杂度较低，只有在个别情况下复杂度才比较高。

2.复杂度低和复杂度高是有时序关系的，比如一个 O(n) 插入之后，紧跟着 n-1 个 O(1) 的插入操作，循环往复。

在这种情况下，我们才会使用均摊复杂度，均摊复杂度指的是把耗时最多的那次时间复杂度均摊到接下来每次耗时较少的复杂度上。

二、为什么要引入这4个概念？

1.同一段代码在不同情况下时间复杂度会出现量级差异，为了更全面，更准确的描述代码的时间复杂度，所以引入这4个概念。

2.代码复杂度在不同情况下出现量级差别时才需要区别这四种复杂度。大多数情况下，是不需要区别分析它们的。

三、如何分析平均、均摊时间复杂度？

1.平均时间复杂度代码在不同情况下复杂度出现量级差别，则用代码所有可能情况下执行次数的加权平均值表示。

2.均摊时间复杂度

两个条件满足时使用：

1）代码在绝大多数情况下是低级别复杂度，只有极少数情况是高级别复杂度；

2）低级别和高级别复杂度出现具有时序规律。均摊结果一般都等于低级别复杂度。

亦难猿

关注

2
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
浅析最好、最坏、平均、均摊时间复杂度

// n 表示数组 array 的长度int find(int[] array, int n, int x) { int i = 0; int pos = -1; for (; i &lt; n; ++i) { if (array[i] == x){ pos = i; } } return pos;}这是一个在无序（Array）数组中寻...
复制链接

扫一扫

专栏目录