NLP学习记录 第一天 最大匹配算法

分词工具Jieba   (还有很多)   例:

 前向最大匹配算法:需要定义一个参数,就是最大的单词字数(maxlen),从前扫到最后,先看前五个字组成的单词有没有在词典库出现,如果没有,就看前四个,依次类推。。。。

贪心算法,每此只会选择当前最优解,只能看到当前布局,一般不能保证全局最优。DP算法可以降低算法复杂度,能看到全局(很重要)还有BEAN SEARCH。

后向最大匹配:字面意思,和前向相反。

前向后向分出来可能不一样,这里介绍‘一篇CSDN:(22条消息) 中文分词引擎 java 实现 — 正向最大、逆向最大、双向最大匹配法_selinda001的博客-CSDN博客

分词缺点:1、不能细分   2、局部最优   3、效率低(maxlen)4、不能考虑语义

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 打赏
    打赏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

carrymybaby

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值