jieba自然语言处理-头歌

第1关:使用jieba进行分词

任务描述

本关任务:对对应内容进行分词,转换成列表后输出。

我想起花瓣  试着掉落  为你翘课的那一天

花落的那一天  教室的那一间  我怎么看不见

import  jieba
jieba.setLogLevel(jieba.logging.INFO)
'''请输入未完成内容'''
s='我想起花瓣试着掉落为你翘课的那一天花落的那一天教室的那一间我怎么看不见'
print(jieba.lcut(s))

第2关:飘-词频统计

任务描述

本关任务:编写一个程序,统计哈姆雷特中出现最多的5个单词(无需排除)。

def gettext():
    txt=open('/data/workspace/myshixun/src/step2/gonewind.txt','r',encoding='utf-8').read()
    '''请输入未完成内容'''
    txt = txt.lower()
    for i in '!"#$%&()*+,-./:;<=>?@[\\]^_‘{|}~':
        txt = txt.replace(i, " ")
    return txt
hamletTxt = gettext()
words = hamletTxt.split()
counts = {}  #新建一个空字典
for word in words:
    counts[word] = counts.get(word, 0) + 1  #对单词出现的频率进行统计


'''请输入未完成内容'''
items = list(counts.items())
items.sort(key=lambda x: x[1], reverse=True)

for i in range(5):
    '''请输入未完成内容'''
    word,count = items[i]
    print("{0:<10}{1:>5}".format(word,count))
    

第3关:三国-词频统计

任务描述

本关任务:编写程序,统计三国中人名出现最多的5个人(排除非相关词)。

import jieba
jieba.setLogLevel(jieba.logging.INFO)
excludes={'将军','却说','二人','不可','不能','如此','荆州'}
txt=open('/data/workspace/myshixun/src/step3/sanguo1.txt','r',encoding='utf-8').read()
'''
 
添加未完成内容'''
words = jieba.lcut(txt)
counts = {}
for word in words:
    if len(word) ==1:
        continue
    elif word=="诸葛亮" or word=="孔明曰":rword="孔明"
    elif word=="关公" or word=="云长":rword="关羽"
    elif word=="玄德" or word=="玄德曰":rword="刘备"
    elif word=="孟德" or word=="丞相":rword="曹操"
    elif word=="后主" or word=="阿斗":rword="刘禅"
    #elif word=="都督" or word=="公瑾":rword="周瑜"
    elif word=="子龙" :rword="赵云"
    else:rword=word
    counts[rword]=counts.get(rword,0)+1
for word in excludes:#若存在上述excludes里面的词组都不是词组,然后减一
    del(counts[word])
items=list(counts.items())
items.sort(key=lambda x:x[1],reverse=True)#通过出现的次数降序排序输出
for i in range(5):
    word,count=items[i]
    print("{0:<10}{1:>5}".format(word,count))

  • 0
    点赞
  • 3
    收藏
    觉得还不错? 一键收藏
  • 打赏
    打赏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

Gouzy_

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值