好玩的分词——python jieba分词模块的基本用法

最新推荐文章于 2023-06-18 09:59:02 发布

dnxbjyj

最新推荐文章于 2023-06-18 09:59:02 发布

阅读量3.2k

点赞数 3

分类专栏：数据挖掘文章标签： python 分词结巴 jieba

本文链接：https://blog.csdn.net/dnxbjyj/article/details/72854460

版权

jieba是一个强大的中文分词库，提供精确模式、全模式和搜索引擎模式。本文介绍了如何安装jieba，使用不同分词模式，获取词性，进行并行分词，获取高频词以及利用用户字典提高分词准确性。

摘要由CSDN通过智能技术生成

jieba（结巴）是一个强大的分词库，完美支持中文分词，本文对其基本用法做一个简要总结。

安装jieba

pip install jieba

结巴分词分为三种模式：精确模式（默认）、全模式和搜索引擎模式，下面对这三种模式分别举例介绍：

import jieba
s = u'我想和女朋友一起去北京故宫博物院参观和闲逛。'

cut = jieba.cut(s)

print '【Output】'
print cut
print ','.join(cut)

【Output】
<generator object cut at 0x7f8dbc0efc30>
我,想,和,女朋友,一起,去,北京故宫博物院,参观,和,闲逛,。

可见分词结果返回的是一个生成器（这对大数据量数据的分词尤为重要）。

print '【Output】'
print ','.join(jieba.cut(s,cut_all = True))

【Output】
我,想,和,女朋友,朋友,一起,去,北京,北京故宫,北京故宫博物院,故宫,故宫博物院,博物,博物院,参观,和,闲逛,,

可见全模式就是把文本分成尽可能多的词。

print '【Output】'
print ','.join(jieba.cut_for_search(s))

【Output】
我,想,和,朋友,女朋友,一起,去,北京,故宫,博物,博物院,北京故宫博物院,参观,和,闲逛,。

每个词都有其词性，比如名词、动词、代词等，结巴分词的结果也可以带上每个词的词性，要用到jieba.posseg，举例如下：

关注

专栏目录