大数据最全一看就懂的大数据排序算法：如何给100万用户数据排序？(2)，2024年最新自学者福利

2401_84591619

于 2024-05-11 19:41:18 发布

阅读量599

点赞数 13

分类专栏：程序员文章标签：大数据面试学习

本文链接：https://blog.csdn.net/2401_84591619/article/details/138727806

版权

程序员专栏收录该内容

58 篇文章 0 订阅

订阅专栏

既有适合小白学习的零基础资料，也有适合3年以上经验的小伙伴深入学习提升的进阶课程，涵盖了95%以上大数据知识点，真正体系化！

由于文件比较多，这里只是将部分目录截图出来，全套包含大厂面经、学习笔记、源码讲义、实战项目、大纲路线、讲解视频，并且后续会持续更新

需要这份系统化资料的朋友，可以戳这里获取

如果要排序的数据有 n 个，我们把它们均匀地划分到 m 个桶内，每个桶里就有 k=n/m 个元素。每个桶内部使用快速排序，时间复杂度为 O(k * logk)。m 个桶排序的时间复杂度就是 O(m * k * logk)，因为 k=n/m，所以整个桶排序的时间复杂度就是 O(n*log(n/m))。当桶的个数 m 接近数据个数 n 时，log(n/m) 就是一个非常小的常量，这个时候桶排序的时间复杂度接近 O(n)。

那既然桶排序这么的优秀，为什么我们在平时的使用中却偏向于其他的排序方法呢（大多数情况下偏向于时间复杂度为O(nlogn)的快排）？

桶排序的小缺点

桶排序对要排序数据的要求是非常苛刻的。

首先，要排序的数据需要很容易就能划分成 m 个桶，并且，桶与桶之间有着天然的大小顺序。

其次，数据在各个桶之间的分布是比较均匀的。如果数据经过桶的划分之后，有些桶里的数据非常多，有些非常少，很不平均，那桶内数据排序的时间复杂度就不是常量级了。

桶排序比较适合用在外部排序中。所谓的外部排序就是数据存储在外部磁盘中，数据量比较大，内存有限，无法将数据全部加载到内存中。

比如说我们有 10GB 的数据，我们希望对这波数据进行排序，但是我们的内存有限，只有1G，没办法一次性把 10GB 的数据都加载到内存中。这个时候该怎么办呢？

我们可以先扫描一遍文件，看数据所处的数据范围。假设经过扫描之后我们得到，数据最小为1，最大为1000。我们将所有数据划分到 100 个桶里，第一个桶我们存储在 1 元到 10 元之内的数据，第二桶存储在 11 元到 20 元之内的数据，以此类推。每一个桶对应一个文件，并且按照数据范围的大小顺序编号命名（00，01，02…99）。

理想的情况下，如果数据均匀分布，那数据会被均匀划分到 100 个文件中，每个小文件中存储大约 100MB 的数据，我们就可以将这 100 个小文件依次放到内存中，用快排来排序。等所有文件都排好序之后，我们只需要按照文件编号，从小到大依次读取每个小文件中的数据，并将其写入到一个文件中。

不过呢，不均匀才是常态嘛，有可能某个区间的数据特别多，划分之后对应的文件就会很大，没法一次性读入内存。这又该怎么办呢？

针对这些划分之后还是比较大的文件，我们可以继续划分。

如果划分之后，数据还是太多，无法一次性读入内存，那就继续再划分，直到所有的文件都能读入内存为止。

计数排序（Counting sort）

计数排序其实是桶排序的一种特殊情况。

还是上面那个例子来说，区间跨度为1000，那就分它一千个桶，每一个数据位一个桶。

我们就当这波数据都是整数，所以并不需要再进行排序。我们只需要依次扫描每个桶，将桶内的数据依次输出到一个文件中，就实现了 10G 数据的排序。因为只涉及扫描遍历操作，所以时间复杂度是 O(n)。