Python 读取各类文件格式的文本信息 doc,excel,html,mht_python 文件格式获取(2)

乐于分享小码农

于 2024-05-02 16:41:32 发布

阅读量41

点赞数 26

分类专栏：程序员文章标签： python excel html

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/mxzsybkj/article/details/138394540

版权

程序员专栏收录该内容

132 篇文章 0 订阅

订阅专栏

python拥有直接操作excel表格的第三方库xlwt,xlrd。调用对应的方法就可以读写excel表格数据。

读取excel操作代码如下:

其中row是表格数据对应的行数， cell获取具体行数，列数的具体数据。

三、Python读取doc文档数据

python读取doc文档是最麻烦的。处理逻辑复杂。处理的方式也有很多种。

python 没有直接处理doc文档的第三方库，但是有一个处理docx的第三方库。可以通过将doc文件转换为docx文件，再调用第三方python库pydocx来读取doc文档的内容。

这里需要注意的是,不要直接修改doc的后缀来修改成docx文件。直接通过修改后缀获取的docx文件，pydocx无法读取内容。

我们可以使用另外一个库来修改doc为docx。

具体代码如下:

代码所需的包接口:

python处理docx文档的方法有很多种，具体使用情况，根据个人需求来决定。

No.1 解压docx文件

docx文件的原理，本质上就是一个压缩的zip文件，通过解压以后，就可以获取原来文件的各个内容。

docx解压后的文件结构如下:

docx文件的文本内容存储结构如下:

文本内容存储于word/document.xml文件中。

第一种方法，我们就可以先将docx还原成zip压缩文件，再解压zip文件，读取word/document.xml文件的内容就ok了。

具体操作代码如下:

最后获取到的就是docx文档的所有文本数据了。

No.2 将docx文档转换成python能够处理的文本格式

第一种方法，是依据docx文档的原理来获取数据,流程有点繁琐，有没有能直接读取docx文档内容的方法呢？答案，肯定是没有的，别想了，洗洗回家睡吧。

直接读取docx文档的方法没有，有没有能够将docx文档转换成python能够轻松处理的文本格式呢？

这个可以有，前面说了，python拥有大量丰富的第三方库（先夸一波我大python）,历经千辛万苦终于找到了，一个能转换docx文档格式的第三方库,pydocx,pydocx库中有个方法pydocx.to_html()就可以直接将docx文档转换为html文件，怎么样？意不意外，惊喜不惊喜！

第二种方法，转换文本格式的代码如下:

获取到的response是html文件内容。

四、Python处理mht文件

mht文件是一种只能在IE浏览器上展示的文本格式，在chrome浏览器中打开是一堆的乱码。

No.1 伪造IE请求mht文件内容

最基础的读取mht文本的方法就是伪造IE浏览器请求。

调用requests库，发送get请求网页链接，构造IE的请求头信息。

理论上来说，这种方法是可行的。但是呢，不建议用，原因大家都懂得。

在这里插入图片描述

感谢每一个认真阅读我文章的人，看着粉丝一路的上涨和关注，礼尚往来总是要有的：

①　2000多本Python电子书（主流和经典的书籍应该都有了）

②　Python标准库资料（最全中文版）

③　项目源码（四五十个有趣且经典的练手项目及源码）

④　Python基础入门、爬虫、web开发、大数据分析方面的视频（适合小白学习）

⑤ Python学习路线图（告别不入流的学习）

网上学习资料一大堆，但如果学到的知识不成体系，遇到问题时只是浅尝辄止，不再深入研究，那么很难做到真正的技术提升。

需要这份系统化学习资料的朋友，可以戳这里无偿获取

一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！

乐于分享小码农

关注

26
点赞
踩
19

收藏

觉得还不错? 一键收藏
0
评论
Python 读取各类文件格式的文本信息 doc,excel,html,mht_python 文件格式获取(2)

这个可以有，前面说了，python拥有大量丰富的第三方库（先夸一波我大python）,历经千辛万苦终于找到了，一个能转换docx文档格式的第三方库,pydocx,pydocx库中有个方法pydocx.to_html()就可以直接将docx文档转换为html文件，怎么样？第一种方法，是依据docx文档的原理来获取数据,流程有点繁琐，有没有能直接读取docx文档内容的方法呢？docx文件的原理，本质上就是一个压缩的zip文件，通过解压以后，就可以获取原来文件的各个内容。理论上来说，这种方法是可行的。
复制链接

扫一扫

专栏目录

乐于分享小码农 CSDN认证博客专家 CSDN认证企业博客

码龄1年

147: 原创

26万+: 周排名

1万+: 总排名

8万+: 访问

: 等级

3432: 积分

1477: 粉丝

1936: 获赞

9: 评论

1860: 收藏

私信

关注

热门文章

分类专栏

作者\/ 3篇
程序员 132篇

最新评论

早看少被坑！每个学习Python的需要经历的问题_pycharm使用教程 -推广 --推广链接
普通网友: 优质好文，细节很到位！【我也写了一些相关领域的文章，希望能够得到博主的指导，共同进步！】
ActiveMQ应用
CSDN-Ada助手: 恭喜您写了第四篇博客，看来您对ActiveMQ应用有着深入的了解呢！希望您能继续保持创作的热情和努力，不断分享您的经验和见解。或许下一步可以考虑深入探讨ActiveMQ的高级应用技巧或者与其他技术的结合，让读者能够更全面地了解这个话题。期待您更多精彩的文章！如何快速涨粉，请看该博主的分享：https://hope-wisdom.blog.csdn.net/article/details/130544967?utm_source=csdn_ai_ada_blog_reply5
ActiveMQ应用
Y小夜: 这篇文章结构合理，衔接自然紧凑，看完之后确实让我学习到了不少东西，是一篇优质的技术分享文章。三连了！
ActiveMQ应用
The-Venus: 非常喜欢这篇博客！博主的写作风格简洁明了，让人一目了然。文章内容丰富，涵盖了很多实用的知识点，对我来说非常有帮助。尤其是博主在文章中提供了很多实际操作的步骤和技巧，让我能够更好地应用所学的知识。同时，博主的配图也很精美，更加生动地展示了文章中的内容。总之，非常感谢博主的分享，期待博主能够继续输出这样优质的好文。
2024JAVA面试重点问题
CSDN-Ada助手: 非常感谢您分享这篇关于Mybatis学习笔记的博客！看到您对Alibaba的敬仰和对学习的认真态度，让人感到非常钦佩。除了Mybatis，您可能还想了解一下Alibaba的其他开源项目，比如Dubbo和RocketMQ等，这些都是非常热门的技术，也值得深入学习。希望您能继续保持对技术的热情，不断努力，加油！如何写出更高质量的博客，请看该博主的分享：https://blog.csdn.net/lmy_520/article/details/128686434?utm_source=csdn_ai_ada_blog_reply2

您愿意向朋友推荐“博客详情页”吗？

强烈不推荐
不推荐
一般般
推荐
强烈推荐

提交

最新文章

2024

目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。