文本预处理——python数据读入

最新推荐文章于 2024-05-01 21:26:03 发布

林灵会灭

最新推荐文章于 2024-05-01 21:26:03 发布

阅读量1.1k

点赞数 1

本文链接：https://blog.csdn.net/qq_35159009/article/details/90698085

版权

文本预处理专栏收录该内容

3 篇文章 2 订阅

订阅专栏

1 数据读入

1.1 后缀名为docx

anaconda环境，cmd

pip install docx

2.x便可直接使用，
但是3.x版本不兼容，import docx会显示
Import Error: No module named ‘exceptions’
解决方法：
在https://www.lfd.uci.edu/~gohlke/pythonlibs/
找到python_docx-0.8.10-py2.py3-none-any.whl
提示：倒着找，在混合的那里
在这里插入图片描述
下载到本地，在本地文件夹，shift+右键，点击“在此处打开命令行窗口”，输入

pip uninstall docx  #如果之前没有装docx，可以不使用
pip install python_docx-0.8.10-py2.py3-none-any.whl

接着就可以使用啦

import docx
docx = docx.Document('1.变革我们的世界：2030年可持续发展议程.docx')
#输出每段文字
for para in docx.paragraphs:
    print(para.text)

当然，也可以直接将docx文件转为txt文件

import docx2txt
text = docx2txt.process('1.变革我们的世界：2030年可持续发展议程.docx')

这样，text变量储存了一段str格式的文本

1.2 表格格式

这个最简单啦

import pandas as pd
data1 = pd.read_excel("文件名.xlsx",encoding = 'utf-8')
data2 = pd.read_excel("文件名.xls")
data3 = pd.read_csv("文件名.csv",encoding = 'gbk')

看是否会报错，切换encoding为gbk，或者utf-8
变量是一个DataFrame，然后可以直接通过列名获得所需要的列

content = data3['列名']

另一个需要注意的是，有时候文件名地址中包含中文可能会报错，
提示：Initializing from file failed
所以需要用以下方式

f = open('排序后y值.csv',encoding='utf-8') 
data = pd.read_csv(f)

1.3 text格式

import codecs
with codecs.open('停用词.txt','r',encoding='gbk') as f:
    text = f.read()

直接.read()得到的是一整个字符串
在这里插入图片描述

import codecs
with codecs.open('停用词.txt','r',encoding='gbk') as f:
    text2 = f.readlines()

使用readlines()得到的是一个list
在这里插入图片描述
完成了数据读入，就可以进行接下来的预处理啦，将会包括去重去空、分词、提取关键词、统计描述；以及TF-IDF，word2vec表示，敬请期待！

未完待续

林灵会灭

关注

1
点赞
踩
7

收藏

觉得还不错? 一键收藏
0
评论
文本预处理——python数据读入

1 数据读入1.1 后缀名为docxanaconda环境，cmdpip install docx2.x便可直接使用，但是3.x版本不兼容，import docx会显示Import Error: No module named ‘exceptions’解决方法：在https://www.lfd.uci.edu/~gohlke/pythonlibs/找到python_docx-0....
复制链接

扫一扫