[url]http://onedear.iteye.com/admin/blogs/673724[/url] 这个是修复后的版本,请打开这个连接下载代码
一直喜欢中科院的分词,但由于共享版有时间限制,虽有破解版,但这样用破解就不爽,在其官网找了一个java版的中科院分词imdict-chinese-analyzer
下载地址是
http://ictclas.org/OpenSrcDownCount.asp?PacketId=48&url=down/imdict-chinese-analyzer.zip
用了以后,觉得效果不错,但最大的硬伤是不允许附加词库,但既然源代码都到手了,这种不允许附加的机制当然能改。
最后没有改动源代码,仅仅自己另外写了几个类实现了
使用方式请看附件里面的readme.txt
//不加入默认词库,词库里面没有深圳市这个词,结果是 广东 深 圳 市 onedear
//附加词库后,结果是“广东 深圳市 onedear ”
同时也曾带上词性,但不是很准,所以附件里面的工程就取消了,主要是没有一个很好的算法跟思想,对多义词不知道应如何处理。希望大家能给给意见。