自然语言处理第三期

  1. 基本文本处理技能
    1.1 分词的概念(分词的正向最大、逆向最大、双向最大匹配法);
    正向最大匹配法:定义一个最大长度,从前向后选取最大长度的字符串,然后与词典的词进行匹配,如果匹配到了就停止,如果没匹配到就去除最后面的一个数,继续匹配,直至匹配到词典的词或剩一个字为止,就为分词;对句子剩下的字符串坐相同处理,最后得到分词。
    例如:句子 = “我今天在学习”,最大长度N=5
    第一轮:
    第一次:”我今天在学”,扫描5字词典,无
    第二次:“我今天在”,扫描4字词典,无
    第三次:“我今天”,扫描3字词典,无
    第四次:“我今”,扫描2字词典,无
    第五次:“我”,切分
    第二轮:
    第一次:”今天在学习”,扫描5字词典,无
    第二次:“今天在学”,扫描4字词典,无
    第三次:“今天在”,扫描3字词典,无
    第四次:“今天”,扫描2字词典,有,切分

    最后分词结果:我/今天/在/学习
    逆向最大匹配法:与正向最大匹配法相反,该方法是从后向前选取最大字符串,然后匹配。
    例如:句子 = “我今天在学习”,最大长度N=5
    第一轮:
    第一次:”今天在学习”,扫描5字词典,无
  • 0
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值