海量数据中找出前k大数(topk问题)

本文讨论了在大规模数据中解决top K问题的多种方法,包括最小堆、快速选择和分治策略。最小堆法首先用前k个数建立堆,然后逐个与堆顶元素比较并替换,保持堆的性质。快速选择法通过对数组进行分区操作,递归查找第k大元素。分治法则通过数据分组和局部排序,减少内存消耗。此外,文章还提到了内存受限情况下的解决方案,以及MapReduce框架在处理这类问题上的应用。
摘要由CSDN通过智能技术生成

https://www.cnblogs.com/qlky/p/7512199.html

前两天面试3面学长问我的这个问题(想说TEG的3个面试学长都是好和蔼,希望能完成最后一面,各方面原因造成我无比想去鹅场的心已经按捺不住了),这个问题还是建立最小堆比较好一些。

        先拿10000个数建堆,然后一次添加剩余元素,如果大于堆顶的数(10000中最小的),将这个数替换堆顶,并调整结构使之仍然是一个最小堆,这样,遍历完后,堆中的10000个数就是所需的最大的10000个。建堆时间复杂度是O(mlogm),算法的时间复杂度为O(nmlogm)(n为10亿,m为10000)。

        优化的方法:可以把所有10亿个数据分组存放,比如分别放在1000个文件中。这样处理就可以分别在每个文件的10^6个数据中找出最大的10000个数,合并到一起在再找出最终的结果。

        以上就是面试时简单提到的内容,下面整理一下这方面的问题:

top K问题

        在大规模数据处理中,经常会遇到的一类

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

hello_world!

你的鼓励将是我创作的最大动力!

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值