CQUPT Python 文本词频统计 -- Hamlet - v2

最新推荐文章于 2024-07-24 23:49:50 发布

CQUPT_114514

最新推荐文章于 2024-07-24 23:49:50 发布

阅读量1k

点赞数 1

分类专栏： Python程序设计文章标签： python

本文链接：https://blog.csdn.net/2301_76172695/article/details/130434829

版权

Python程序设计专栏收录该内容

27 篇文章 45 订阅

订阅专栏

【问题描述】

请统计hamlet.txt文件中出现的英文单词情况，统计并输出出现最多的前n个单词，注意：‪‬‪‬‪‬‪‬‪‬‮‬‪‬‭‬‪‬‪‬‪‬‪‬‪‬‮‬‭‬‪‬‪‬‪‬‪‬‪‬‪‬‮‬‫‬‫‬‪‬‪‬‪‬‪‬‪‬‮‬‭‬‫‬‪‬‪‬‪‬‪‬‪‬‮‬‭‬‫‬‪‬‪‬‪‬‪‬‪‬‮‬‪‬‮‬

(1) 单词不区分大小写，即需将大写转换成小写；‪‬‪‬‪‬‪‬‪‬‮‬‫‬‫‬‪‬‪‬‪‬‪‬‪‬‮‬‭‬‪‬‪‬‪‬‪‬‪‬‪‬‮‬‫‬‫‬‪‬‪‬‪‬‪‬‪‬‮‬‭‬‪‬‪‬‪‬‪‬‪‬‪‬‮‬‪‬‭‬‪‬‪‬‪‬‪‬‪‬‮‬‭‬‪‬‪‬‪‬‪‬‪‬‪‬‮‬‫‬‫‬‪‬‪‬‪‬‪‬‪‬‮‬‭‬‫‬‪‬‪‬‪‬‪‬‪‬‮‬‭‬‫‬‪‬‪‬‪‬‪‬‪‬‮‬‪‬‮‬

(2) 请在文本中剔除如下特殊符号：!"#$%&()*+,-./:;<=>?@[\\]^_‘{|}~‪‬‪‬‪‬‪‬‪‬‮‬‪‬‭‬‪‬‪‬‪‬‪‬‪‬‮‬‭‬‪‬‪‬‪‬‪‬‪‬‪‬‮‬‫‬‫‬‪‬‪‬‪‬‪‬‪‬‮‬‭‬‫‬‪‬‪‬‪‬‪‬‪‬‮‬‭‬‫‬‪‬‪‬‪‬‪‬‪‬‮‬‪‬‮‬

(3) 输出n个单词和其出现次数，每个单词一行；‪‬‪‬‪‬‪‬‪‬‮‬‪‬‭‬‪‬‪‬‪‬‪‬‪‬‮‬‭‬‪‬‪‬‪‬‪‬‪‬‪‬‮‬‫‬‫‬‪‬‪‬‪‬‪‬‪‬‮‬‭‬‫‬‪‬‪‬‪‬‪‬‪‬‮‬‭‬‫‬‪‬‪‬‪‬‪‬‪‬‮‬‪‬‮‬

(4) 输出单词为小写形式。

此题不涉及编码转换，若想指定编码可在开始加上

#-*- coding: utf-8 -*-

或在文件打开处指定编码

with open("hamlet.txt", "r", encoding='utf-8') as f：

........

【输出形式】

以下仅是输出样例（仅列出3个，需要列出n个），不是最终结果：‪‬‪‬‪‬‪‬‪‬‮‬‪‬‭‬‪‬‪‬‪‬‪‬‪‬‮‬‭‬‪‬‪‬‪‬‪‬‪‬‪‬‮‬‫‬‫‬‪‬‪‬‪‬‪‬‪‬‮‬‭‬‫‬‪‬‪‬‪‬‪‬‪‬‮‬‭‬‫‬‪‬‪‬‪‬‪‬‪‬‮‬‪‬‮‬

the 1138

and 965

to 754

单词左对齐，并占10个位置；次数右对齐，并占5个位置

【完整代码】

# 读文件，并将大写转换成小写
with open("hamlet.txt", "r", encoding='utf-8') as f:
    s = f.read().lower()
# 剔除特殊符号
sp = '!"#$%&()*+,-./:;<=>?@[\\]^_‘{|}~'
for i in sp:
    s = s.replace(i, ' ')
# 统计单词出现次数
ls = s.split()
dic = {}
for i in ls:
    dic[i] = dic.get(i, 0) + 1
cnt = sorted(dic.items(), key=lambda x: x[1], reverse=True)
# 输入输出
n = int(input())
for i in cnt[:n]:
    print(f"{i[0]:<10}{i[1]:>5}")

【代码讲解】