Nutch爬虫工作流程及文件格式详细分析
来源: 作者:
时间:2009-05-10 Tag:Nutch 爬虫 工作流程 文件格式 详细分析 点击: 23
Nutch主要分为两个部分:爬虫crawler和查询searcher。Crawler主要用于从网络上抓取网页并为这些网页建立索引。 Searcher主要利用这些索引检索用户的查找关键词来产生查找结果。两者之间的接口是索引,所以除去索引部分,两者之间的耦合度很低。
[url]http://www.josdoc.com/html/sousuo/Nutch/shenruyanjiu/200905/10-733.html[/url]
来源: 作者:
时间:2009-05-10 Tag:Nutch 爬虫 工作流程 文件格式 详细分析 点击: 23
Nutch主要分为两个部分:爬虫crawler和查询searcher。Crawler主要用于从网络上抓取网页并为这些网页建立索引。 Searcher主要利用这些索引检索用户的查找关键词来产生查找结果。两者之间的接口是索引,所以除去索引部分,两者之间的耦合度很低。
[url]http://www.josdoc.com/html/sousuo/Nutch/shenruyanjiu/200905/10-733.html[/url]