经典排序算法
排序算法的说明
1 排序算法说明
1.1 排序的定义
对一序列对象根据某个关键字进行排序。
1.2 术语说明
- 稳定:如果a原本在b前面,而a=b,排序之后a仍然在b的前面;
- 不稳定:如果a原本在b的前面,而a=b,排序之后a可能会出现在b的后面;
- 内排序:所有排序操作都在内存中完成;
- 外排序:由于数据太大,因此把数据放在磁盘中,而排序通过磁盘和内存的数据传输才能进行;
- 时间复杂度: 一个算法执行所耗费的时间。
- 空间复杂度:运行完一个程序所需内存的大小。
1.3 算法总结
图片名词解释:
- n: 数据规模
- k: “桶”的个数
- In-place: 占用常数内存,不占用额外内存
- Out-place: 占用额外内存
1.4 算法分类
比较和非比较的区别:
常见的快速排序、归并排序、堆排序、冒泡排序等属于比较排序。在排序的最终结果里,元素之间的次序依赖于它们之间的比较。每个数都必须和其他数进行比较,才能确定自己的位置:
在冒泡排序之类的排序中,问题规模为n,又因为需要比较n次,所以平均时间复杂度为O(n²);在归并排序、快速排序之类的排序中,问题规模通过分治法消减为logN次,所以时间复杂度平均O(nlogn)。
比较排序的优势是适用于各种规模的数据,也不在乎数据的分布,都能进行排序。可以说,比较排序适用于一切需要排序的情况。
计数排序、基数排序、桶排序则属于非比较排序。非比较排序是通过确定每个元素之前,应该有多少个元素来排序。针对数组arr,计算arr[i]之前有多少个元素,则唯一确定了arr[i]在排序后数组中的位置。
非比较排序只要确定每个元素之前的已有的元素个数即可,所有一次遍历即可解决。算法时间复杂度O(n)。非比较排序时间复杂度低,但由于非比较排序需要占用空间来确定唯一位置。所以对数据规模和数据分布有一定的要求。
2 排序算法
2.1 冒泡排序
冒泡排序是一种简单的排序算法。它重复地走访过要排序的数列,一次比较两个元素,如果它们的顺序错误就把它们交换过来。走访数列的工作是重复地进行直到没有再需要交换,也就是说该数列已经排序完成。
2.1.1 算法描述
- 比较相邻的元素。如果第一个比第二个大,就交换它们两个;
- 对每一对相邻元素作同样的工作,从开始第一对到结尾的最后一对,这样在最后的元素应该会是最大的数;
- 针对所有的元素重复以上的步骤,除了最后一个;
- 重复步骤1~3,直到排序完成。
2.1.2 算法实现
def BubbleSort(alist):
for i in range(len(alist)-1, 0, -1):
for j in range(i):
if alist[j] > alist[j+1]:
alist[j], alist[j+1] = alist[j+1], alist[j]
return alist
2.1.3 算法分析
最 佳 情 况 : T ( n ) = O ( n ) ; 最 差 情 况 : T ( n ) = O ( n 2 ) ; 平 均 情 况 : T ( n ) = O ( n 2 ) 最佳情况:T(n) = O(n);最差情况:T(n) = O(n^2) ;平均情况:T(n) = O(n^2) 最佳情况:T(n)=O(n);最差情况:T(n)=O(n2);平均情况:T(n)=O(n2)
2.2 选择排序(Selection-sort)
选择排序是一种简单直观的排序算法。原理:首先在未排序序列中找到最小(大)元素,存放到排序序列的起始位置,再从剩余未排序元素中继续寻找最小(大)元素,然后放到已排序序列的末尾。以此类推,直到所有元素均排序完毕。是最稳定的排序算法之一
2.2.1 算法描述
n个记录的直接选择排序可经过n-1趟直接选择排序得到有序结果。具体算法描述如下:
- 初始状态:无序区为R[1…n],有序区为空;
- 第i趟排序(i=1,2,3…n-1)开始时,当前有序区和无序区分别为R[1…i-1]和R(i…n)。该趟排序从当前无序区中-选出关键字最小的记录 R[k],将它与无序区的第1个记录R交换,使R[1…i]和R[i+1…n)分别变为记录个数增加1个的新有序区和记录个数减少1个的新无序区;
- n-1趟结束,数组有序化了。
2.2.2 算法实现
def SelectionSort(alist):
for i in range(len(alist) - 1, 0, -1):
for j in range(i):
if alist[i] < alist[j]:
alist[j], alist[i] = alist[i], alist[j]
return alist
2.2.3 算法分析
最 佳 情 况 : T ( n ) = O ( n 2 ) ; 最 差 情 况 : T ( n ) = O ( n 2 ) ; 平 均 情 况 : T ( n ) = O ( n 2 ) 最佳情况:T(n) = O(n^2); 最差情况:T(n) = O(n^2); 平均情况:T(n) = O(n^2) 最佳情况:T(n)=O(n2);最差情况:T(n)=O(n2);平均情况:T(n)=O(n2)
2.3 插入排序(Insertion-Sort)
插入排序描述是一种简单直观的排序算法。原理是通过构建有序序列,对于未排序数据,在已排序序列中从后向前扫描,找到相应位置并插入。插入排序在实现上,通常采用in-place排序(即只需用到O(1)的额外空间的排序),因而在从后向前扫描过程中,需要反复把已排序元素逐步向后挪位,为最新元素提供插入空间。
2.3.1 算法描述
具体算法描述如下:
- 从第一个元素开始,该元素可以认为已经被排序;
- 取出下一个元素,在已经排序的元素序列中从后向前扫描;
- 如果该元素(已排序)大于新元素,将该元素移到下一位置;
- 重复步骤3,直到找到已排序的元素小于或者等于新元素的位置;
- 将新元素插入到该位置后;
重复步骤2~5。
2.3.2 算法实现
def InsertionSort(alist):
for index in range(1, len(alist)):
currentvalue = alist[index]
position = index
while position > 0 and alist[position-1] > currentvalue:
alist[position] = alist[position-1]
position -= 1
alist[position] = currentvalue
return alist
2.3.3 算法分析
最 佳 情 况 : T ( n ) = O ( n ) ; 最 差 情 况 : T ( n ) = O ( n 2 ) ; 平 均 情 况 : T ( n ) = O ( n 2 ) 最佳情况:T(n) = O(n); 最差情况:T(n) = O(n^2); 平均情况:T(n) = O(n^2) 最佳情况:T(n)=O(n);最差情况:T(n)=O(n2);平均情况:T(n)=O(n2)
2.4 希尔排序(Shell Sort)
希尔排序是希尔(Donald Shell)于1959年提出的一种排序算法。希尔排序也是一种插入排序,它是简单插入排序经过改进之后的一个更高效的版本,也称为缩小增量排序,同时该算法是冲破O(n2)的第一批算法之一。它与插入排序的不同之处在于,它会优先比较距离较远的元素。希尔排序又叫缩小增量排序。
希尔排序是把记录按下表的一定增量分组,对每组使用直接插入排序算法排序;随着增量逐渐减少,每组包含的关键词越来越多,当增量减至1时,整个文件恰被分成一组,算法便终止。
2.4.1 算法描述
先将整个待排序的记录序列分割成为若干子序列分别进行直接插入排序,具体算法描述:
- 选择一个增量序列t1,t2,…,tk,其中ti>tj,tk=1;
- 按增量序列个数k,对序列进行k 趟排序;
- 每趟排序,根据对应的增量ti,将待排序列分割成若干长度为m 的子序列,分别对各子表进行直接插入排序。仅增量因子为1 时,整个序列作为一个表来处理,表长度即为整个序列的长度。
2.4.2 算法实现
def ShellSort(alist):
sub_list_count = len(alist)//2
while sub_list_count > 0:
for start_position in range(sub_list_count):
gapInsertionSort(alist, start_position, sub_list_count) # 子排序
print('After increments of size:', sub_list_count, 'This list is', alist)
sub_list_count = sub_list_count // 2
def gapInsertionSort(alist, start, gap):
for i in range(start+gap, len(alist), gap):
current_value = alist[i]
position = i
while position >= gap and alist[position-gap] > current_value:
alist[position] = alist[position-gap]
position = position-gap
alist[position] = current_value
2.4.3 算法分析
最 佳 情 况 : T ( n ) = O ( n l o g 2 n ) ; 最 坏 情 况 : T ( n ) = O ( n l o g 2 n ) ; 平 均 情 况 : T ( n ) = O ( n l o g 2 n ) 最佳情况:T(n) = O(nlog_2 n); 最坏情况:T(n) = O(nlog_2 n) ; 平均情况:T(n) =O(nlog_2n) 最佳情况:T(n)=O(nlog2n);最坏情况:T(n)=O(nlog2n);平均情况:T(n)=O(nlog2n)
2.5 归并排序(Merge Sort)
归并排序是建立在归并操作上的一种有效的排序算法。该算法是采用分治法(Divide and Conquer)的一个非常典型的应用。归并排序是一种稳定的排序方法。将已有序的子序列合并,得到完全有序的序列;即先使每个子序列有序,再使子序列段间有序。若将两个有序表合并成一个有序表,称为2-路归并。
2.5.1 算法描述
工作原理:
- 把长度为n的输入序列分成两个长度为n/2的子序列;
- 对这两个子序列分别采用归并排序;
- 将两个排序好的子序列合并成一个最终的排序序列。
2.5.2 算法实现
def MergeSort(alist):
if len(alist) > 1:
mid = len(alist) // 2
left_half = MergeSort(alist[:mid])
right_half = MergeSort(alist[mid:])
else:
return alist
return merge(left_half, right_half)
def merge(a, b):
list = []
i = j = 0
while i < len(a) and j < len(b):
if a[i] < b[j]:
list.append(a[i])
i += 1
else:
list.append(b[j])
j += 1
if i == len(a):
for k in b[j:]:
list.append(k)
else:
for k in a[i:]:
list.append(k)
return list
if __name__ == '__main__':
# 测试
test_list = [54, 26, 93, 17, 77, 31, 55, 44, 20, 1]
list = MergeSort(test_list)
print('Merging:', list)
2.5.3 算法分析
最 佳 情 况 : T ( n ) = O ( n ) ; 最 差 情 况 : T ( n ) = O ( n l o g n ) ; 平 均 情 况 : T ( n ) = O ( n l o g n ) 最佳情况:T(n) = O(n) ; 最差情况:T(n) = O(nlogn) ; 平均情况:T(n) = O(nlogn) 最佳情况:T(n)=O(n);最差情况:T(n)=O(nlogn);平均情况:T(n)=O(nlogn)
2.6 快速排序(Quick Sort)
快速排序通过一趟排序将待排记录分隔成独立的两部分,其中一部分记录的关键字均比另一部分的关键字小,则可分别对这两部分记录继续进行排序,以达到整个序列有序。
2.6.1 算法描述
快速排序使用分治法来把一个串(list)分为两个子串(sub-lists)。具体算法描述如下:
- 从数列中挑出一个元素,称为 “基准”(pivot);
- 重新排序数列,所有元素比基准值小的摆放在基准前面,所有元素比基准值大的摆在基准的后面(相同的数可以到任一边)。在这个分区退出之后,该基准就处于数列的中间位置。这个称为分区(partition)操作;
- 递归地(recursive)把小于基准值元素的子数列和大于基准值元素的子数列排序。
2.6.2 算法实现
def QuickSort(alist):
quick(alist, 0, len(alist)-1)
return alist
def quick(alist, fiest, last):
if fiest < last:
split_point = partition(alist, fiest, last)
quick(alist, fiest, split_point-1)
quick(alist, split_point+1, last)
def partition(alist, first, last):
pivot_value = alist[first]
left_mark = first+1
right_mark = last
done = False
while not done:
while left_mark <= right_mark and alist[left_mark] <= pivot_value:
left_mark += 1
while alist[right_mark] >= pivot_value and right_mark >= left_mark:
right_mark -= 1
if right_mark < left_mark:
done = True
else:
alist[right_mark], alist[left_mark] = alist[left_mark], alist[right_mark]
alist[first], alist[right_mark] = alist[right_mark], alist[first]
return right_mark
2.6.3 算法分析
最 佳 情 况 : T ( n ) = O ( n l o g n ) ; 最 差 情 况 : T ( n ) = O ( n 2 ) ; 平 均 情 况 : T ( n ) = O ( n l o g n ) 最佳情况:T(n) = O(nlogn); 最差情况:T(n) = O(n^2); 平均情况:T(n) = O(nlogn) 最佳情况:T(n)=O(nlogn);最差情况:T(n)=O(n2);平均情况:T(n)=O(nlogn)
2.7 堆排序(Heap Sort)
堆排序是利用堆进行排序的方法。其基本思想为:将待排序列构造成一个大顶堆(或小顶堆),整个序列的最大值(或最小值)就是堆顶的根结点,将根节点的值和堆数组的末尾元素交换,此时末尾元素就是最大值(或最小值),然后将剩余的n-1个序列重新构造成一个堆,这样就会得到n个元素中的次大值(或次小值),如此反复执行,最终得到一个有序序列。
2.7.1 算法描述
- 将初始待排序关键字序列(R1,R2….Rn)构建成大顶堆,此堆为初始的无序区;
- 将堆顶元素R[1]与最后一个元素R[n]交换,此时得到新的无序区(R1,R2,……Rn-1)和新的有序区(Rn),且满足R[1,2…n-1]<=R[n];
- 由于交换后新的堆顶R[1]可能违反堆的性质,因此需要对当前无序区(R1,R2,……Rn-1)调整为新堆,然后再次将R[1]与无序区最后一个元素交换,得到新的无序区(R1,R2….Rn-2)和新的有序区(Rn-1,Rn)。不断重复此过程直到有序区的元素个数为n-1,则整个排序过程完成。
2.7.2 算法实现
def sift(list, low, high):
"""
low:堆的根节点
high:堆最后一个元素的位置
"""
i = low # i指向根节点
j = 2 * i + 1 # j开始指向左子节点
tmp = list[low] # 封存堆顶
while j <= high:
if j + 1 <= high and list[j+1] > list[j]: # 右子节点存在且比左子节点大
j = j + 1 # j指向右子节点
if list[j] > tmp: # 如果j指向节点比根节点大,再往下寻找
list[i] = list[j] # i指向j层,j再指向下一层
i = j
j = 2 * i + 1
else:
break
list[i] = tmp # 将tmp放到叶子结点上
def heap_sort(list): # 建堆
n = len(list)
for i in range((n//2)-1, -1, -1):
sift(list, i, n-1)
for i in range(n-1, -1, -1):
list[0], list[i] = list[i], list[0]
sift(list, 0, i-1)
return list
2.7.3 算法分析
最 佳 情 况 : T ( n ) = O ( n l o g n ) ; 最 差 情 况 : T ( n ) = O ( n l o g n ) ; 平 均 情 况 : T ( n ) = O ( n l o g n ) 最佳情况:T(n) = O(nlogn); 最差情况:T(n) = O(nlogn); 平均情况:T(n) = O(nlogn) 最佳情况:T(n)=O(nlogn);最差情况:T(n)=O(nlogn);平均情况:T(n)=O(nlogn)