Stanford Word Segmenter是斯坦福大学NLP group研发的一套基于CRF的开源中文分词系统,采用CRF(Conditional Random Fields)算法。下面将下载Stangford Word Segmenter 软件包,在Eclipse上调试成功,并进一步分析源码。
1,下载 Stanford Word Segmenter软件包;
Download Stanford Word Segmenter version 2014-06-16
2,在eclipse上建立一个Project StanfordSegmenter。解压Stanford Word Segmenter软件包,将其中的data,arabic,test.sipe.utf8文件夹复制到项目下。