使用kenlm工具训练统计语言模型

使用kenlm工具训练统计语言模型

一、背景

统计语言模型工具有比较多的选择,目前使用比较好的有srilm及kenlm,其中kenlm比srilm晚出来,训练速度也更快,而且支持单机大数据的训练。现在介绍一下kenlm的使用方法。

二、使用kenlm训练 n-gram

  1. 工具主页:http://kheafield.com/code/kenlm/
  2. 工具包的下载地址:http://kheafield.com/code/kenlm.tar.gz
  3. 使用。该工具在linux环境下使用方便,windows下使用需要用cygwin 64模拟linux环境使用。 先确保linux环境已经按照1.36.0的Boost和zlib,
boost:
yum install boost
yum install boost-devel

zlib:
yum install zlib
yum install zlib-devel

然后gcc版本需要是4.8.2及以上。kenlm.tar.gz工具包下载,解压,进入子目录运行 ./bjam 进行编译。
也可以参考官方编译方法:

wget -O - https://kheafield.com/code/kenlm.tar.gz |tar xz
mkdir kenlm/build
cd kenlm/build
cmake ..
make -j4
  1. 训练。使用如下命令进行训练:
build/bin/lmplz -o 3 --verbose_header --text people2014corpus_words.txt --arpa result/people2014corpus_words.arps

其中,
1)people2014corpus_words.txt文件必须是分词以后的文件。
2)-o后面的3表示的是3-gram,一般取到3即可,但可以结合自己实际情况判断。

  1. 压缩。压缩模型为二进制,方便模型快速加载:
build/bin/build_binary ./result/people2014corpus_words.arps ./result/people2014corpus_words.klm
  • 0
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 3
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 3
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值