大数据量的问题是很多面试笔试中经常出现的问题,比如
baidu
、
google
腾讯
这样的一些涉及到海量数据的公司经常会问到。
下面的方法是我对海量数据的处理方法进行了一个一般性的总结,当然这些方法可能并不能完全覆盖所有的问题,但是这样的一些方法也基本可以处理绝大多数遇到的问题。下面的一些问题基本直接来源于公司的面试笔试题目,方法不一定最优,如果你有更好的处理方法,欢迎与我讨论。
本贴从解决这类问题的方法入手,开辟一系列专题来解决海量数据问题。拟包含
以下几个方面。1. Bloom Filter 2. Hash 3. Bit-Map 4. 堆(Heap) 5. 双层桶划分 6. 数据库索引 7. 倒排索引(Inverted Index) 8. 外排序 9. Trie树 10. MapReduce
文章放在我的 百度空间 档案收藏里面,有空再补上。