Search Engine
caizhongda
这个作者很懒,什么都没留下…
展开
-
Heritrix 项目介绍和架构 Nutch比较
Heritrix项目介绍Heritrix工程始于2003年初,IA的目的是开发一个特殊的爬虫,对网上的资源进行归档,建立网络数字图书馆。在过去的6年里,IA已经建立了400TB的数据。 IA期望他们的crawler包含以下几种: 宽带爬虫:能够以更高的带宽去站点爬。 主题爬虫:集中于被选择的问题。 持续爬虫:不仅仅爬更当前的网页还负责爬日后更新的网页。 实验爬虫:对爬虫...2009-09-21 09:02:46 · 68 阅读 · 0 评论 -
Nutch 命令
Nutch采用了一种命令的方式进行工作,其命令可以是对局域网方式的单一命令也可以是对整个Web进行爬取的分步命令。主要的命令如下: 1. Crawl Crawl是“org.apache.nutch.crawl.Crawl”的别称,它是一个完整的爬取和索引过程命令。 使用方法: Shell代码 bin/nutch crawl [-dir d] [-threads n] [-...2009-09-21 18:38:55 · 152 阅读 · 0 评论 -
搜索引擎常用工具总结
Luke ---索引管理工具箱 [url]http://www.getopt.org/luke[/url]下载LIMO ---索引监视器 [url]http://limo.sourceforge.net/[/url] Lucli ---Lucene命令行接口 Heritrix --网络爬虫Nutch ---网络爬虫 相关英文指导说明:[url]htt...2009-09-21 19:16:38 · 118 阅读 · 0 评论