- 博客(1)
- 资源 (2)
- 收藏
- 关注
转载 bloom filter 程序演示
这是spider url 队列一环的要害之一。 爬虫必然要考虑的问题之一就是url的去重问题,很容易想到的方法是 hashmap/hashtable(md5(url)):程序退出时序列化并写入持久介质,启动时重新读入,反序列化载入内存。或者考虑如Berkeley DB等key-value结构的持久存储方案,可以屏蔽了很多如持久化、高并发、随机/顺序存储等操作。忽略md5的重复几率,在数据量不是太
2012-02-22 23:48:12 684
空空如也
空空如也
TA创建的收藏夹 TA关注的收藏夹
TA关注的人