hanlp 训练模型_开源自然语言处理工具包hanlp中CRF分词实现详解

最新推荐文章于 2023-03-29 21:49:52 发布

VIP文章 rossdawson

最新推荐文章于 2023-03-29 21:49:52 发布

阅读量375

点赞数

文章标签： hanlp 训练模型

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_42469649/article/details/112243110

版权

CRF简介

CRF是序列标注场景中常用的模型，比HMM能利用更多的特征，比MEMM更能抵抗标记偏置的问题。

[gerative-discriminative.png]

CRF训练

这类耗时的任务，还是交给了用C++实现的CRF++。关于CRF++输出的CRF模型，请参考《CRF++模型格式说明》。

CRF解码

解码采用维特比算法实现。并且稍有改进，用中文伪码与白话描述如下：

首先任何字的标签不仅取决于它自己的参数，还取决于前一个字的标签。但是第一个字前面并没有字，何来标签？所以第一个字的处理稍有不同，假设第0个字的标签为X，遍历X计算第一个字的标签，取分数最大的那一个。

如何计算一个字的某个标签的分数呢？某个字根据CRF模型提供的模板生成了一系列特征函数，这些函数的输出值乘以该函数的权值最后求和得出了一个分数。该分数只是“点函数”的得分，还需加上“边函数”的得分。边函数在本分词模型中简化为f(s’,s)，其中s’为前一个字的标签，s为当前字的标签。于是该边函数就可以用一个4*4的矩阵描述，相当于HMM中的转移概率。

实现了评分函数后，从第二字开始即可运用维特比后向解码，为所有字打上BEMS标签。

实例

最低0.47元/天解锁文章

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
hanlp 训练模型_开源自然语言处理工具包hanlp中CRF分词实现详解

CRF简介CRF是序列标注场景中常用的模型，比HMM能利用更多的特征，比MEMM更能抵抗标记偏置的问题。[gerative-discriminative.png] CRF训练这类耗时的任务，还是交给了用C++实现的CRF++。关于CRF++输出的CRF模型，请参考《CRF++模型格式说明》。 CRF解码解码采用维特比算法实现。并且稍有改进，用中文伪码与白话描述如下：首先任何字的标签不仅取决于它自己...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。