中文自然语言处理工具hanlp隐马角色标注详解

最新推荐文章于 2022-01-30 09:32:25 发布

adnb34g

最新推荐文章于 2022-01-30 09:32:25 发布

阅读量709

点赞数

分类专栏：大数据大数据 hanlp 文章标签： hanlp 角色标注

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/adnb34g/article/details/87180665

版权

本文旨在介绍如何利用HanLP训练分词模型，包括语料格式、语料预处理、训练接口、输出格式等。目前HanLP内置的训练接口是针对一阶HMM-NGram设计的，另外附带了通用的语料加载工具，可以通过少量代码导出供其他训练工具使用的特定格式（如CRF++）。

语料格式

输入语料格式为人民日报分词语料库格式。该格式并没有明确的规范，但总体满足以下几点：

1、单词与词性之间使用“/”分割，如华尔街/nsf，且任何单词都必须有词性，包括标点等。

2、单词与单词之间使用空格分割，如美国/nsf 华尔街/nsf 股市/n。

3、支持用[]将多个单词合并为一个复合词，如[纽约/nsf 时报/n]/nz，复合词也必须遵守1和2两点规范。

你可以参考OpenCorpus/pku98/199801.txt（作者并无版权，请勿询问）。

语料预处理

语料预处理指的是将语料加载到内存中，根据需要增删改其中部分词语的一个过程。在HanLP中，这是通过CorpusLoader.walk实现的：

最低0.47元/天解锁文章

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。