1 数据读入
1.1 后缀名为docx
anaconda环境,cmd
pip install docx
2.x便可直接使用,
但是3.x版本不兼容,import docx会显示
Import Error: No module named ‘exceptions’
解决方法:
在https://www.lfd.uci.edu/~gohlke/pythonlibs/
找到python_docx-0.8.10-py2.py3-none-any.whl
提示:倒着找,在混合的那里
下载到本地,在本地文件夹,shift+右键,点击“在此处打开命令行窗口”,输入
pip uninstall docx #如果之前没有装docx,可以不使用
pip install python_docx-0.8.10-py2.py3-none-any.whl
接着就可以使用啦
import docx
docx = docx.Document('1.变革我们的世界:2030年可持续发展议程.docx')
#输出每段文字
for para in docx.paragraphs:
print(para.text)
当然,也可以直接将docx文件转为txt文件
import docx2txt
text = docx2txt.process('1.变革我们的世界:2030年可持续发展议程.docx')
这样,text变量储存了一段str格式的文本
1.2 表格格式
这个最简单啦
import pandas as pd
data1 = pd.read_excel("文件名.xlsx",encoding = 'utf-8')
data2 = pd.read_excel("文件名.xls")
data3 = pd.read_csv("文件名.csv",encoding = 'gbk')
看是否会报错,切换encoding为gbk,或者utf-8
变量是一个DataFrame,然后可以直接通过列名获得所需要的列
content = data3['列名']
另一个需要注意的是,有时候文件名地址中包含中文可能会报错,
提示:Initializing from file failed
所以需要用以下方式
f = open('排序后y值.csv',encoding='utf-8')
data = pd.read_csv(f)
1.3 text格式
import codecs
with codecs.open('停用词.txt','r',encoding='gbk') as f:
text = f.read()
直接.read()得到的是一整个字符串
import codecs
with codecs.open('停用词.txt','r',encoding='gbk') as f:
text2 = f.readlines()
使用readlines()得到的是一个list
完成了数据读入,就可以进行接下来的预处理啦,将会包括去重去空、分词、提取关键词、统计描述;以及TF-IDF,word2vec表示,敬请期待!
未完待续