CRF学习二：多个分词模型对比

最新推荐文章于 2023-10-10 12:22:58 发布

慕虞

最新推荐文章于 2023-10-10 12:22:58 发布

阅读量594

点赞数

分类专栏： NLP入门文章标签： CRF++

NLP入门专栏收录该内容

7 篇文章 2 订阅

订阅专栏

CRF简介

Conditional Random Field：条件随机场，一种机器学习技术（模型）.

CRF由John Lafferty最早用于NLP技术领域，其在NLP技术领域中主要用于文本标注，并有多种应用场景，例如：

分词（标注字的词位信息，由字构词）
词性标注（标注分词的词性，例如：名词，动词，助词）
命名实体识别（识别人名，地名，机构名，商品名等具有一定内在规律的实体名词）

本文主要描述如何使用CRF技术来进行中文分词。

CRF VS 词典统计分词

1，基于词典的分词过度依赖词典和规则库，因此对于歧义词和未登录词的识别能力较低；其优点是速度快，效率高；

2，CRF代表了新一代的机器学习技术分词，其基本思路是对汉字进行标注即由字构词(组词)，不仅考虑了文字词语出现的频率信息，同时考虑上下文语境，具备较好的学习能力，因此其对歧义词和未登录词的识别都具有良好的效果；其不足之处是训练周期较长，运营时计算量较大，性能不如词典分词；

CRF VS HMM，MEMM

1，首先，CRF，HMM(隐马模型)，MEMM(最大熵隐马模型)都常用来做序列标注的建模，像分词、词性标注，以及命名实体标注；

2，隐马模型一个最大的缺点就是由于其输出独立性假设，导致其不能考虑上下文的特征，限制了特征的选择；

3，最大熵隐马模型则解决了隐马的问题，可以任意选择特征，但由于其在每一节点都要进行归一化，所以只能找到局部的最优值，同时也带来了标记偏见的问题，即凡是训练语料中未出现的情况全都忽略掉；

4，条件随机场则很好的解决了这一问题，他并不在每一个节点进行归一化，而是所有特征进行全局归一化，因此可以求得全局的最优值。

CRF分词原理

CRF把分词当做字的词位分类问题，通常定义字的词位信息如下：

词首，常用B表示
词中，常用M表示
词尾，常用E表示
单子词，常用S表示
CRF分词的过程就是对词位标注后，将B和E之间的字，以及S单字构成分词
CRF分词实例：

原始例句：我爱北京天安门
CRF标注后：我/S 爱/S 北/B 京/E 天/B 安/M 门/E
分词结果：我/爱/北京/天安门

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
CRF学习二：多个分词模型对比

CRF简介Conditional Random Field：条件随机场，一种机器学习技术（模型）CRF由John Lafferty最早用于NLP技术领域，其在NLP技术领域中主要用于文本标注，并有多种应用场景，例如：分词（标注字的词位信息，由字构词）词性标注（标注分词的词性，例如：名词，动词，助词）命名实体识别（识别人名，地名，机构名，商品名等具有一定内在规律的实体名词）本文主要描述如...
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。