5、分词算法

1、正向最大匹配:已有字典,最长词长度为m,判断当前位置i到i+m中存在的最长的词

2、反向最大匹配:相反

3、双向最大匹配:正向和逆向同时进行,取效果最好的,效果最好的评价标准是:分词结果词的数量少,单个字少

4、HMM分词。自己之前写过,就是隐马尔可夫过程,原地址贴过来了

https://blog.csdn.net/cuipanguo/article/details/82114083

5、我记得还有一种方法是凝固度和自由度来做新词的发现

     自由度:一个词左右两边的词的固定程度。一个词左右的自由度越大,越有可能是一个词,如果自由度很小,说明很容易和左边和右边组成一个新的词。用熵来计算自由度。

    凝固度:两个词同时使用的程度。越大,越有可能组成新的词。

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值