Nutch+Hadoop集群搭建

Nutch数据包含3个目录结构,分别是:


1、Crawldb:用于存储Nutch将要检索的url信息,以及检索状态(是否检索、何时检索)


2、Linkdb:用于存储每一个url所包含的超链接信息(包括锚点)


3、Segments:一组url的集合,他们作为一个检索单元,可用于分布式检索


Segment目录包含以下子目录信息:


(1)   crawl_generate:定义将要检索的url集合(文件类型为SequenceFile)


(2)   crawl_fetch:存储每一个url的检索状态(文件类型为MapFile)


(3)   content:存储每一个url所对应的二进制字节流(文件类型为MapFile)


(4)   parse_text:存储每一个url所解析出的文本内容(文件类型为MapFile)


(5)   parse_data:存储每一个url所解析出的元数据(文件类型为MapFile)


(6)   crawl_parse:用于及时更新crawldb中的内容(如要检索的url已不存在等情况)--文件类型为SequenceFile


注:结合Nutch的数据结构和组件结构来看,crawldb相当于WebDB,而segment相当于是fetchlists.


分布式crawl过程中,每个MapReduce Job都会生成一个segment,名称以时间来命名

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
这是本人在完全分布式环境下在Cent-OS中配置Nutch-1.1时的总结文档,但该文档适合所有Linux系统和目前各版本的nutch。 目 录 介绍 ............................................................... 2 0 集群网络环境介绍 ................................................. 2 1 /etc/hosts文件配置 ............................................... 2 2 SSH无密码验证配置 ................................................ 2 2.1配置所有节点之间SSH无密码验证 ................................ 2 3 JDK安装和Java环境变量配置 ........................................ 3 3.1 安装 JDK 1.6 ................................................ 3 3.2 Java环境变量配置 ............................................ 4 4 Hadoop集群配置 ................................................... 4 5 Hadoop集群启动 ................................................... 6 6 Nutch分布式爬虫 .................................................. 9 6.1配置Nutch配置文件 ............................................ 9 6.2 执行Nutch分布式爬虫 ........................................ 10 7 Nutch检索 ....................................................... 13 7.1 Windows下Nutch单机搜索本地索引数据 ......................... 13 7.2 Linux下Nutch单机搜索本地索引数据 ........................... 14 7.2.1 WEB前端搜索 ........................................... 14 7.2.2 命令行搜索 ............................................ 15 7.3 Linux下Nutch搜索HDFS中索引数据 ............................. 15 7.3.1 WEB前端搜索
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值