Python jieba 中文分词与词频统计

#! python3
# -*- coding: utf-8 -*-
import os, codecs
import jieba
from collections import Counter

def get_words(txt):
    seg_list = jieba.cut(txt)
    c = Counter()
    for x in seg_list:
        if len(x)>1 and x != '\r\n':
            c[x] += 1
    print('常用词频度统计结果')
    for (k,v) in c.most_common(100):
        print('%s%s %s  %d' % ('  '*(5-len(k)), k, '*'*int(v/3), v))

if __name__ == '__main__':
    with codecs.open('19d.txt', 'r', 'utf8') as f:
        txt = f.read()
    get_words(txt)

样本:十九大报告全文

常用词频度统计结果
      发展 **********************************************************************  212
      中国 ********************************************************  168
      人民 ****************************************************  157
      建设 *************************************************  148
  社会主义 ************************************************  146
      坚持 *******************************************  130
      国家 ******************************  90
      全面 *****************************  88
      制度 ***************************  83
      实现 ***************************  83
      推进 ***************************  81
      政治 **************************  80
      社会 **************************  80
      特色 **************************  79
      加强 ***********************  71
      体系 **********************  68
      文化 **********************  66
      我们 *********************  64
      时代 *********************  63
      必须 ********************  61
      经济 *******************  59
      伟大 *******************  58
      完善 *****************  51
      我国 ****************  50
      推动 ***************  47
    现代化 ***************  47
      安全 ***************  46
      更加 **************  44
      民主 **************  44	
	


  • 15
    点赞
  • 89
    收藏
    觉得还不错? 一键收藏
  • 3
    评论
评论 3
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值