python统计excel 表中某一列文本的词频

本文介绍如何使用Python统计Excel文件中某一列文本的词频。首先将Excel文件转换为CSV格式解决格式错误问题,然后进行词频统计,最终成功显示出统计结果。
摘要由CSDN通过智能技术生成

`

python统计excel 表中某一列文本的词频


代码如下

# jieba库的使用以及csv库的使用
import jieba
import csv
txt = open("complaint.csv", 'rt', encoding='utf-8').read()  # 读取所需要分析的文件内容
Excel = open
要进行PythonExcel词频统计,可以使用pandas和jieba库进行操作。首先,你需要读取Excel文件,可以使用pandas的`read_excel`函数来读取文件内容。然后,定义一个函数用于分词和统计词频。在这个函数中,你可以使用jieba库对文章内容进行分词,并使用collections库中的Counter函数统计词频。接下来,创建一个新的数据框,用于存储统计结果。然后,遍历每个智库名称和主题,筛选符合条件的行,并将文章内容合并为一个字符串。对合并后的内容进行分词和统计词频,并将统计结果写入新数据框。最后,将新数据框存储到Excel文件中。以下是一个示例代码: ``` import pandas as pd import jieba from collections import Counter # 读取 Excel 文件 df = pd.read_excel('your_excel_file.xlsx') # 定义函数用于分词和统计词频 def word_freq(content): # 对文章内容进行分词 words = jieba.cut(content) # 统计词频 return Counter(words) # 创建新的数据框 new_df = pd.DataFrame(columns=['智库名称', '主题', '词语', '词频']) # 遍历每个智库名称和主题 for think_tank in df['think_tank_name'].unique(): for topic in df['type'].unique(): # 筛选符合条件的行,并将文章内容合并为一个字符串 temp_df = df[(df['think_tank_name']==think_tank) & (df['type']==topic)] content = ''.join(temp_df['art_content'].tolist()) # 进行分词和统计词频 freq = word_freq(content) # 将统计结果写入新数据框 for word, count in freq.items(): new_df = new_df.append({ '智库名称': think_tank, '主题': topic, '词语': word, '词频': count }, ignore_index=True) # 将新数据框存储到 Excel 文件中 new_df.to_excel('new_excel_file.xlsx', index=False) ``` 上述代码会统计Excel中每个智库名称和主题下文章内容的词频,并将结果存储到新的Excel文件中。你可以根据实际情况修改文件名和列名。总结起来,PythonExcel词频统计的方法是:读取Excel文件、定义分词和统计函数、创建新的数据框、遍历并统计词频、将结果存储到Excel文件中。<span class="em">1</span><span class="em">2</span><span class="em">3</span> #### 引用[.reference_title] - *1* [python 技能树练习题《代码规范(风格)》 词频统计源码](https://download.csdn.net/download/wenrui7868/88279898)[target="_blank" data-report-click={"spm":"1018.2226.3001.9630","extra":{"utm_source":"vip_chatgpt_common_search_pc_result","utm_medium":"distribute.pc_search_result.none-task-cask-2~all~insert_cask~default-1-null.142^v93^chatsearchT3_2"}}] [.reference_item style="max-width: 33.333333333333336%"] - *2* [用python词频统计](https://blog.csdn.net/EaSoNgo111/article/details/129994837)[target="_blank" data-report-click={"spm":"1018.2226.3001.9630","extra":{"utm_source":"vip_chatgpt_common_search_pc_result","utm_medium":"distribute.pc_search_result.none-task-cask-2~all~insert_cask~default-1-null.142^v93^chatsearchT3_2"}}] [.reference_item style="max-width: 33.333333333333336%"] - *3* [python统计excel 表中一列文本词频](https://blog.csdn.net/qq_44965200/article/details/111355947)[target="_blank" data-report-click={"spm":"1018.2226.3001.9630","extra":{"utm_source":"vip_chatgpt_common_search_pc_result","utm_medium":"distribute.pc_search_result.none-task-cask-2~all~insert_cask~default-1-null.142^v93^chatsearchT3_2"}}] [.reference_item style="max-width: 33.333333333333336%"] [ .reference_list ]
评论 5
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值