为什么需要复杂度分析?
代码跑一遍,通过统计、监控,就能得到算法执行的时间和占用的内存大小。这种评估算法执行效率的方法是正确的,叫事后统计法,但是有很大的局限性。
- 测试结果非常依赖测试环境
- 测试结果受数据规模的影响很大
大O复杂度表示法
算法的执行效率,粗略的讲,就是算法代码执行的时间。
int cal(int n){ int sum = 0; int i = 1; int j = 1; for(;i <= n ; ++i ){ j= i; for(;j <= n; ++j ){ sum = sum + i * j; } } } |
假设每个语句的执行时间是unit_time.那这段代码的总执行时间T(n)是多少呢?
第2、3、4行代码,每行都需要1个unit_time的执行时间,第5、6 行代码循环执行了n遍,需要2n*unit_time的执行时间,第7、 8行代码循环执行了n² * unit_time 的执行时间。所以,整段代码总的执行时间T(n) = (2n² + 2n +3) * unit_time。
规律:所有代码的执行时间T(n)与每行代码的执行次数n成正比。
总结为一个公式大O:T(n) = O(f(n))
T(n):表示代码的执行时间
n:表示数据规模的大小
f(n):表示每行代码执行的次数总和
O:表示代码的执行时间T(n)与f(n)表达式成正比
大O时间复杂度实际上并不具体表示代码的真正的执行时间,而是表示代码执行时间随数据规模增长的变化趋势,所以叫作:
渐进时间复杂度,简称时间复杂度。
时间复杂度分析
1.只关注循环执行次数最多的一段代码(单段代码看高频:比如循环)
2.加法法则:总复杂度等于量级最大的那段代码的复杂度(多段代码取最大:比如一段代码中有单循环和多重循环,那么取多重循环的复杂度)
3.乘法法则:嵌套代码的复杂度等于嵌套内外代码复杂度的乘积(嵌套代码求乘积:比如递归、多重循环)
4多个规模求加法:比如方法中有两个参数控制两个循环的次数,那么这时就取二者复杂度相加。
分为两类:多项式量级和非多项式量级
多项式量级只有两个:O(2n) 和 O(n!)
时间复杂度为非多项式量级的算法问题叫作NP问题
当数据规模n越来越大时,非多项式量级算法的执行时间会急剧增加,求解问题的执行时间会无限增长。所以,非多项式时间复杂度的算法其实是非常低效的算法。
1.O(1)
首先你必须明确一个概念,O(1)只是常量级时间复杂度的一种 表示方法,并不是指只执行了一行代码。只要代码的执行时间不随n的增长而增长,这样代码的时间复杂度我们都记作O(1)。或者说,一般情况下,只要算法中不存在循环语句、递归语句,即使有成千上万行代码,其时间复杂度也是O(1)。
2. O(logn)、O(nlogn)
i = 1; while(i <= n){ i = i * 2; } |
从 代码中可以看出,变量i的值从1开始取,每循环一次就乘以2.当大于n时,循环结束。
通过 2x=n 求解 x 这个问题我们想高中应该就学过了,x=log2n
时间复杂度就是 O(log2n)
统一为O(logn)。
如果循环执行n遍,时间复杂度就是O(nlogn),比如归并排序、快速排序的时间复杂度。
3.O(m+n)、O(m*n)
代码的复杂度由两个数据的规模来决定。
int cal(int m,int n){ int sum_1 = 0; int i = 1; for(;i < m; ++i){ sum_1 = sum_1 + i; }
int sum_2 = 0; int j = 1; for(; j< n; ++j){ sum_2 = sum_2 + j; }
return sum_1 + sum_2; } |
m和n是表示两个数据规模,我们无法事先评估m和n谁的量级大,所以我们在复杂度的时候,就不能简单的利用加法规则,省略掉其中一个,所以时间复杂度为O(m+n)
空间复杂度分析
空间复杂度全称渐进空间复杂度,表示算法的存储空间与数据规模之间的增长关系。
void print(int n){ int i = 0; int [] a = new int[n]; for(i; i < n; ++i){ a[i] = i * i; }
for(i = n -1; i >= 0; --i){ print out a[i]; } } |
跟时间复杂度分析一样,我们可以看到,第2行代码中,我们申请了一个空间存储变量i,但是它是常量阶的,跟数据规模n没有关系,所以我们可以忽略,第3行申请了一个大小为n的int类型数组,除此之外,剩下的代码都没有占用更多的空间,所以整段代码的空间复杂度就是O(n)
常见的空间复杂度就是 O(1)、O(n)、O(n2 ),像 O(logn)、O(nlogn)这样的对数阶复杂度平时都用不到。