关于中文分词的统计和规则

最新推荐文章于 2024-03-24 20:00:00 发布

糊糊

最新推荐文章于 2024-03-24 20:00:00 发布

阅读量1.4k

点赞数

分类专栏：一些记录文章标签：中文分词

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/huyoo/article/details/11950875

版权

一些记录专栏收录该内容

101 篇文章 0 订阅

订阅专栏

现在觉得中文分词, 有2种方法, 一个是按照统计规律, 另一个是按照规则.

我觉得不应该完全的分开这2种方法.

就拿统计来说, 就已经在运用规则了:

规则就是: 多次出现的组合字符可以看作是一个词. 简言之就是重复的就是词.

可以看出, 统计的同时就已经在应用规则了.

实际上,我们可以认为, 中文分词只有一种方法, 那就是规则.

规则, 说简单点就是自然规律或者公认的规律.

至于未登录词, 对你的分词器和词典来说, 它确实是未登录词. 但是对它本身来说, 它就是词, 只不过你不认识他而已, 或者说你的规则并没有将它囊括进去.

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
关于中文分词的统计和规则

现在觉得中文分词, 有2种方法, 一个是按照统计规律, 另一个是按照规则.我觉得不应该完全的分开这2种方法.就拿统计来说, 就已经在运用规则了:规则就是: 多次出现的组合字符可以看作是一个词. 简言之就是重复的就是词.可以看出, 统计的同时就已经在应用规则了.实际上,我们可以认为, 中文分词只有一种方法, 那就是规则.规则, 说简单点就是自然规律或者公认的规律.
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。