2016年07月_随时从零开始

07月 06月 05月 04月

转载十道海量数据处理面试题与十个方法大总结

第一部分、十道海量数据处理面试题　　1、海量日志数据，提取出某日访问百度次数最多的那个IP。　　此题，在我之前的一篇文章算法里头有所提到，当时给出的方案是：IP的数目还是有限的，最多2^32个，所以可以考虑使用hash将ip直接存入内存，然后进行统计。　　再详细介绍下此方案：首先是这一天，并且是访问百度的日志中的IP取出来，逐个写入到一个大文件中。注意到IP是32位的，最多

2016-07-28 15:51:19 434

原创堆排序及优先队列

思想堆排序，顾名思义，就是基于堆。因此先来介绍一下堆的概念。堆分为最大堆和最小堆，其实就是完全二叉树。最大堆要求节点的元素都要大于其孩子，最小堆要求节点元素都小于其左右孩子，两者对左右孩子的大小关系不做任何要求，其实很好理解。有了上面的定义，我们可以得知，处于最大堆的根节点的元素一定是这个堆中的最大值。其实我们的堆排序算法就是抓住了堆的这一特点，每次都取堆顶的元素，将其放在序列最后面，然后

2016-07-04 10:23:14 634

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

转载 十道海量数据处理面试题与十个方法大总结

原创 堆排序 及 优先队列

空空如也

空空如也

转载十道海量数据处理面试题与十个方法大总结

原创堆排序及优先队列