python中jieba的用法_浅谈python jieba分词模块的基本用法

最新推荐文章于 2023-11-24 22:01:16 发布

weixin_39868034

最新推荐文章于 2023-11-24 22:01:16 发布

阅读量721

点赞数

文章标签： python中jieba的用法

jieba是一个强大的中文分词库，支持精确、全和搜索引擎三种模式。精确模式适合文本分析，全模式尽可能多切分，搜索引擎模式在精确基础上提高召回率。此外，jieba还支持繁体分词和自定义词典，能获取词性，便于进一步处理。

摘要由CSDN通过智能技术生成

jieba（结巴）是一个强大的分词库，完美支持中文分词，本文对其基本用法做一个简要总结。

特点

支持三种分词模式：

精确模式，试图将句子最精确地切开，适合文本分析；

全模式，把句子中所有的可以成词的词语都扫描出来, 速度非常快，但是不能解决歧义；

搜索引擎模式，在精确模式的基础上，对长词再次切分，提高召回率，适合用于搜索引擎分词。

支持繁体分词

支持自定义词典

MIT 授权协议

安装jieba

pip install jieba

简单用法

结巴分词分为三种模式：精确模式（默认）、全模式和搜索引擎模式，下面对这三种模式分别举例介绍：

精确模式

import jieba

s = u'我想和女朋友一起去北京故宫博物院参观和闲逛。'

cut = jieba.cut(s)

print '【Output】'

print cut

print ','.join(cut)

【Output】

我,想,和,女朋友,一起,去,北京故宫博物院,参观,和,闲逛,。

可见分词结果返回的是一个生成器（这对大数据量数据的分词尤为重要）。

全模式

print '【Output】'

print ','.join(jieba.cut(s,cut_all = True))

【Output】

我,想,和,女朋友,朋友,一起,去,北京,北京故宫,北京故宫博物院,故宫,故宫博物院,博物,博物院,参观,和,闲逛,,

可见全模式就是把文本分成尽可能多的词。

搜索引擎模式

print '【Output】'

print ','.join(jieba.cut_for_search(s))

【Output】

我,想,和,朋友,女朋友,一起,去,北京,故宫,博物,博物院,北京故宫博物院,参观,和,闲逛,。

获取词性

每个词都有其词性，比如名词、动词、代词等，结巴分词的结果也可以带上每个词的词性，要用到jieba.posseg，举例如下：

import jieba.posseg as psg

print '【Output】'

print [(x.word,x.flag) for x in psg.cut(s)]

# 输出：

'''

[(u'我', u'r'), (u'想', u'v'), (u'和', u'c'), (u'女朋友', u'n'), (u'一起', u'm'),

(u'去', u'v'), (u'北京故宫博物院', u'ns'), (u'参观', u'n'), (u'和', u'c'), (u'闲逛', u'v'), (u'。', u'x')]'''

可以看到成功获取到每个词的词性，这对于我们对分词结果做进一步处理很有帮助，比如只想获取分词结果列表中的名词，那么就可以这样过滤：

weixin_39868034

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。