Nutch1.2添加JE分词器

最新推荐文章于 2013-02-25 18:35:29 发布

彷徨的石头

最新推荐文章于 2013-02-25 18:35:29 发布

阅读量898

点赞数

分类专栏： Nutch、Solr 文章标签： apache ant java 工具 string lucene

Nutch、Solr 专栏收录该内容

55 篇文章 0 订阅

订阅专栏

你需要用到的工具有：javacc 、ant、JE分词包。

1.对建立索引所用分词工具的修改

将下载的中文分词包放到lib目录下，改名为analysis-zh.jar(当然，你也可以不用改）。找到下面文件

（1）src\java\org\apache\nutch\analysis\NutchDocumentAnalyzer.java

修改tokenStream方法如下

public TokenStream tokenStream(String fieldName, Reader reader) {
Analyzer analyzer;
analyzer= new MMAnalyzer();
return analyzer.tokenStream(fieldName, reader);
}

注意：由于加入信息的分析类，你需要将该类导入。使用如下语句。

import jeasy.analysis.*;
（2）org.apache.nutch.searcher.Query 修改为：

publicstatic Query parse(String queryString, String queryLang, Configuration conf)

throws IOException {//line 443

try {

returnfixup(NutchAnalysis.parseQuery(

queryString, AnalyzerFactory.get(conf).get(queryLang), conf), conf);

} catch (ParseException e) {

// TODO Auto-generated catch block

e.printStackTrace();

}

returnnull; }

2.对查询所用分析部分的修改

src\java\org\apache\nutch\analysis\中的NutchAnalysis.jj文件

将 <SIGRAM: <CJK> >

改为:| <SIGRAM: (<CJK>)+ >

使用javacc工具将NutchAnalysis.jj生成java文件，共会生成7个java文件，将他们拷贝到下面的文件夹中替换原有文件。

src\java\org\apache\nutch\analysis

如何安装与使用javacc？

下载javacc并解压，然后将javacc的主目录添加到环境变量下。进入命令行，输入javacc，如果不出现不能识别该命令之类的说法，证明安装成功。

进入NutchAnalysis.jj文件所在的目录，输入javacc NutchAnalysis.jj命令就会生成7个java文件了。

3.重新编译工程文件

这里你需要用到ant工具了，那么ant工具怎么安装呢？

ant的安装与配置与 javacc类似，下载后解压，然后在path环境变量中加如指向ant下的bin文件夹的路径。

使用：从命令行进入nutch目录中，输入ant命令，它会自动根据当前目录下的build.xml进行重建。重建完毕后会在改目录下产生一个build文件夹。

4.重建后的文件替换

一、将nutch-0.x.x.job文件拷贝出来替换nutch目录下的同名文件。

二、将\build\classes\org\apache\nutch\analysis目录下的所有文件拷贝替换nutch-0.x.x.jar中org\apache\nutch\analysis目录下的文件。

三、将nutch-0.x.x.jar文件和你的分词包（我的是analysis-zh.jar）拷贝到tomcat中WEB-INF\lib下面。

在build.xml添加一条指令（在第195行的下面加入一行），使的编译war文件的时候加入je-analysis的jar文件。build.xml

</lib>

6.重新爬行与建立索引，重新启动tomcat即可。

彷徨的石头

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
Nutch1.2添加JE分词器

你需要用到的工具有：javacc 、ant、JE分词包。1.对建立索引所用分词工具的修改将下载的中文分词包放到lib目录下，改名为analysis-zh.jar(当然，你也可以不用改）。找到下面文件（1）src\java\org\apache\nutch\analysis\NutchDocumentAnalyzer.java修改tokenStream方法如下
复制链接

扫一扫