位图法
使用场景举例:对2G的数据量进行排序,这是基本要求。
数据:1、每个数据不大于8亿;2、数据类型位int;3、每个数据最多重复一次。
内存:最多用200M的内存进行操作。
首先对占用的内存进行判断,每个数据不大于8亿,那么8亿是一个什么概念呢。
1 byte = 8 bit(位)
1024 byte = 81024 bit = 1k
1024 k = 81024*1024 bit = 1M = 8388608 bit
也就是1M=8388608位
而位图法的基本思想就是利用一位代表一个数字,例如3位上为1,则说明3在数据中出现过,若为0,则说明3在数据中没有出现过。所以当题目中出现每个数据最多重复一次这个条件时,我们可以考虑使用位图法来进行大数据排序。比如说有一个同等长度的int数组,原来一个int元素用来表示一个数据,现在利用int元素的每一位,它可以表示32个元素。
那么假如使用位图法来进行这题的排序,内存占用多少呢。由题目知道每个数据不大于8亿,那么我们就需要8亿位,占用800000000/8388608=95M的空间,满足最多使用200M内存进行操作的条件,这也是这题能够使用位图法来解决的一个基础。
关键代码:
建立一个足够大的Bit数组当做hash表,以bit数组的下标来表示一个整数,以bi
海量数据的排序和查找
最新推荐文章于 2024-05-06 22:23:11 发布
本文介绍了在处理海量数据时,如何利用位图法进行排序,特别是在内存有限的情况下。此外,讨论了堆排序法在找出大量数据中前n个最大或最小值的优势。最后,探讨了分治策略在2G内存单台机器上对10G数据排序的可行性。位图法利用每位代表一个数字,堆排序则适合找出最大值,分治策略通过切分和合并数据进行排序。
摘要由CSDN通过智能技术生成