海量数据实战（0）从两个文件50亿数据中找出相同的URL

qingdujun

已于 2023-07-16 22:44:59 修改

阅读量8.4k

点赞数 5

文章标签：海量数据处理 500亿IP

于 2018-09-03 10:22:20 首次发布

本文链接：https://blog.csdn.net/qingdujun/article/details/82343756

版权

面对50亿URL数据，因内存限制无法一次性加载，采用哈希分治策略，通过BKDRHash算法将URL分散到10000个小文件，再使用集合操作求交，找出相同URL。详细步骤包括URL生成、文件大小判断、文件筛选等，最终实现高效的大数据处理。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

**问题：**给定a、b两个文件，各存放50亿个url，每个url各占64字节，内存限制是4G，让你找出a、b文件共同的url？

文章目录

方案1：每个文件50亿个URL，每个URL最长64个字节，可以估计每个文件安的大小为5000,000,000 ×64bit=320,000,000,000bit ≈ 300,000G，远远大于内存限制的4G，同时需要大硬盘（这里不考虑分布式计算）。所以不可能将其完全加载到内存中处理。考虑采取分而治之的方法。

遍历文件a，对每个url求取 $hash(url)\%100,000$ ，然后根据所取得的值将url分别存储到100,000个小文件（记为 $a_0,a_1,a_2, ..., a_{99998},a_{99999}$ ）中。这样每个小文件的大约为3G。
遍历文件b，采取和a相同的方式将url分别存储到10000小文件中（记为 $b_0,b_1,b_2, ..., b_{99998},b_{99999}$