关闭

[置顶] GTAnalyzer-lucene中文分词

标签: lucene中文分词java中文分词
884人阅读 评论(0) 收藏 举报
分类:
此分词算法主要来源于:http://xiecc.blog.163.com/blog/static/14032200671110224190/


源码svn地址:http://code.taobao.org/svn/gtanalyzer/trunk



可以使用svn下载源代码

 
 1.词典使用树形结构保存,每一个字符占一个树的节点,相同前缀的词在同一棵子树中


 2.使用了正向匹配分词法,但是不受词长限制,可以是任意长度的词
 3.消除歧义,比如:中华人民共和国,可以分为:中华人民共和国/中华人民/人民共和国/人民/共和/共和国;前提是你的词典中有这些词
 4.这个组件不光是lucene的中文分词实现,也是一个独立的java分词组件,不依赖任何jar包,具体的分词在com.wuda.segmentation包下
 5.util包中的CharacterTree.java的findPrefix提供根据前缀找单词的功能,这个可以用于搜索框的输入提示功能
 

测试结构: 我的是联想E420电脑,加载28万个单词 1.加载平均用时9秒; 2.分词速度平均110万中文字/秒,平均2100KB/S 3.随机查找5866个前缀,共用时190ms,平均用时0.032390043ms,包括了排序,提供的排序接口可以是升序或者降序

使用: 1.如果只用于lucene分词,则只需 a)Analyzer analyzer = new GTAnalyzer();

主要是基于lucene4.0开发,不同版本可能有可能不兼容

b)可以在src目录下新增一个gt.properties文件,用于配置自定义词典位置和句分隔符,默认有提供词典。

2.如果只用于前缀匹配: a)CharacterTree tree = new CharacterTree(); //生成空词典 b)tree.load(resource); 或者 tree.add(word); //加载单词 c)PriorityLinkedQueue<Word> queue=new PriorityLinkedQueue<Word>(10,Order.DESC);//降序队列 d)tree.findPrefix(prefix, queue); //前缀查找 e)queue.next() //获取元素

2)如果是作为独立的java分词组件:

a)CharacterTree tree = new CharacterTree(); //生成空词典 

b)tree.load(resource); 或者 tree.add(word); //加载单词

c)Segmenter seg = new GTSegmenter(dic); //分词实例

d)List<Token> tokens= seg.seg(str); // 执行分词

0
0

查看评论
* 以上用户言论只代表其个人观点,不代表CSDN网站的观点或立场
    个人资料
    • 访问:6847次
    • 积分:126
    • 等级:
    • 排名:千里之外
    • 原创:7篇
    • 转载:0篇
    • 译文:0篇
    • 评论:1条
    文章分类
    最新评论