python jieba分词模块

最新推荐文章于 2022-05-14 19:21:39 发布

不愿透露姓名的菜鸟

最新推荐文章于 2022-05-14 19:21:39 发布

阅读量348

点赞数 1

分类专栏： python学习

本文链接：https://blog.csdn.net/Homewm/article/details/84753506

版权

python学习专栏收录该内容

100 篇文章 2 订阅

订阅专栏

这篇博客就是为了方便我自己看。有兴趣的可以看下别人的这篇博客：https://www.cnblogs.com/jiayongji/p/7119065.html

1获取词

import jieba
s = u'我想和女朋友一起去北京故宫博物院参观和闲逛。

cut = jieba.cut(s)
print '【Output】'
print cut
print ','.join(cut)

输出结果：

【Output】
<generator object cut at 0x7f8dbc0efc30>
我,想,和,女朋友,一起,去,北京故宫博物院,参观,和,闲逛,。

2获取词性

import jieba.posseg as psg
print '【Output】'
print [(x.word,x.flag) for x in psg.cut(s)]

# 输出：
'''
[(u'我', u'r'), (u'想', u'v'), (u'和', u'c'), (u'女朋友', u'n'), (u'一起', u'm'), 
(u'去', u'v'), (u'北京故宫博物院', u'ns'), (u'参观', u'n'), (u'和', u'c'), (u'闲逛', u'v'), (u'。', u'x')]
'''

3获取top n的词

from collections import Counter
c = Counter(santi_words).most_common(20)
print c

# 输出：
'''
[(u'\r\n', 21805), (u'一个', 3057), (u'没有', 2128), (u'他们', 1690), (u'我们', 1550), 
(u'这个', 1357), (u'自己', 1347), (u'程心', 1320), (u'现在', 1273), (u'已经', 1259), 
(u'世界', 1243), (u'罗辑', 1189), (u'可能', 1177), (u'什么', 1176), (u'看到', 1114), 
(u'知道', 1094), (u'地球', 951), (u'人类', 935), (u'太空', 930), (u'三体', 883)]
'''

# 开启并行分词模式，参数为并发执行的进程数
jieba.enable_parallel(5)

# 关闭并行分词模式
jieba.disable_parallel()

santi_text = open('./santi.txt').read()
print len(santi_text)

from collections import Counter
c = Counter(santi_words).most_common(20)
print c

# 输出：
'''
[(u'\r\n', 21805), (u'一个', 3057), (u'没有', 2128), (u'他们', 1690), (u'我们', 1550), 
(u'这个', 1357), (u'自己', 1347), (u'程心', 1320), (u'现在', 1273), (u'已经', 1259), 
(u'世界', 1243), (u'罗辑', 1189), (u'可能', 1177), (u'什么', 1176), (u'看到', 1114), 
(u'知道', 1094), (u'地球', 951), (u'人类', 935), (u'太空', 930), (u'三体', 883)]