文本预处理 | （3）分词

最新推荐文章于 2024-07-10 17:20:46 发布

郭畅小渣渣

最新推荐文章于 2024-07-10 17:20:46 发布

阅读量1.2k

点赞数 1

分类专栏： # 文本预处理

本文链接：https://blog.csdn.net/qq_40276310/article/details/109968007

版权

文本预处理专栏收录该内容

7 篇文章 2 订阅

订阅专栏

一、分词的几大难点

1.未登录词的识别

由于新词的不断出现，不存在一个词表能够收录所有的词汇。所以此时就无法将这个词给识别出来。

2.切词产生歧义

比如“羽毛球拍卖完了”就存在两种分词的方式：一种是，羽毛球/拍卖/完了；另一种是，羽毛球拍/卖/完了

3.词的界限无统一标准

比如“自然语言处理”可以看做一个词语，也可以看三个词语“自然”，“语言”，“处理”

二、常用的分词方法

1.机械分词法

基于词典资源的一种分词方法，对文本中的字符串进行匹配，若能在词典中找到，则识别出该词。一般分为，正向最大匹配法，逆向最大匹配法以及最小切分双向最大匹配法。很明显，这种方法简单快速，但是对于未登录词以及切分歧义的情况无法处理。

2.基于N-gram的分词法

这种方法的中心思想就是，假设每个词的出现只和它之前的N-1个词相关，通过大量的语料统计便可以得知句子中每个词的出现概率，继而计算出整个句子的出现概率。但这种方法的计算开销大，而且也无法处理未登录词的问题。

3.基于HMM的分词法

这种就是一种序列标注的方法，基于BME的思想，详情可以看一下序列标注的任务

4.基于CRF的分词法

也是基于序列标注的任务，不同于HMM的假设，在HMM中，当前隐藏状态只受上一时刻隐状态的影响，观测变量只与当前隐状态相关。而CRF考虑的影响范围更大，估计更多数量的特征函数以及相应权重。因此，精度也更高，当然计算代价也偏高。

5.基于深度学习的分词法

深度学习中的循环神经网络也适用于序列标注问题，因此也可以解决分词的任务。比如，首先将文本转化为词嵌入层（即转化为词向量），再将词嵌入层输入LSTM结构，通过有监督学习便可以学习出序列标注。

三、中文分词工具

1.StanfordCoreNLP

from stanfordcorenlp import StanfordCoreNLP
# 加载分词工具
nlp_model = StanfordCoreNLP(r'stanford-corenlp-full-2018-02-27', lang='zh')
# 分词
s = '自然语言处理很有趣'
word_seg = nlp_model.word_tokenize(s)
# 输出分词结果
print(word_seg)
# ['自然', '语言', '处理', '很', '有趣']

2.HanLP

HanLP由大快搜索主导开发，包含了一系列自然语言处理操作。

from pyhanlp import *
# 分词
s = '自然语言处理很有趣'
word_seg = HanLP.segment(s)
# 输出分词结果
print(word_seg)
# ['自然', '语言', '处理', '很', '有趣']

3.THULAC

THUAC（THU Lexical Analyzer for Chinese）是由清华大学研发的具有中文词汇分析功能的自然语言处理工具。

import thulac
# 加载分词工具
thulac_model = thulac.thulac()
# 分词
s = '自然语言处理很有趣'
word_seg = thulac_model.cut(s)
# 输出分词结果
print(word_seg)
# [['自然', 'n'], ['语言', 'n'], ['处理', 'v'], ['很', 'd' ], ['有趣', 'a']]

4.SnowNLP

SnowNLP是用于中文自然语言处理的工具，主要用于分词、情感分析等。

from snownlp import SnowNLP
# 分词
s = '自然语言处理很有趣'
word_seg = SnowNLP(s).words
# 输出分词结果
print(word_seg)
# ['自然', '语言', '处理', '很', '有趣']

5.jieba

jieba是一个专门针对中文分词的应用工具，分词效果不错，并且提供了多种分词模式。

import jieba
s = '自然语言处理很有趣'
# 全模式分词
wordseg_all = jieba.lcut(s, cut_all=True)
# 输出分词结果
print(wordseg_all)
# ['自然', '自然语言', '语言', '处理', '很', '有趣']

# 精确模式分词
wordseg = jieba.lcut(s, cut_all=False)
# 输出分词结果
print(wordseg)
# ['自然语言', '处理', '很', '有趣']

# 搜索引擎模式分词
wordseg_search = jieba.lcut_for_search(s)
print(wordseg_search)
# ['自然', '语言', '自然语言', '处理', '很', '有趣']

6.LTP

哈工大研发的，官网是有教程的（后期补充）

后记：其实分词也可以看做是序列标注的一种。

郭畅小渣渣

关注

1
点赞
踩
6

收藏

觉得还不错? 一键收藏
0
评论
文本预处理 | （3）分词

一、分词的几大难点1.未登录词的识别由于新词的不断出现，不存在一个词表能够收录所有的词汇。所以此时就无法将这个词给识别出来。2.切词产生歧义比如“羽毛球拍卖完了”就存在两种分词的方式：一种是，羽毛球/拍卖/完了；另一种是，羽毛球拍/卖/完了3.词的界限无统一标准比如“自然语言处理”可以看做一个词语，也可以看三个词语“自然”，“语言”，“处理”二、常用的分词方法1.机械分词法基于词典资源的一种分词方法，对文本中的字符串进行匹配，若能在词典中找到，则识别出该词。一般分为.
复制链接

扫一扫

专栏目录