Python 读取各类文件格式的文本信息 doc,excel,html,mht_python 文件格式获取(3)

最新推荐文章于 2024-06-14 16:18:01 发布

乐于分享小码农

最新推荐文章于 2024-06-14 16:18:01 发布

阅读量45

点赞数 23

分类专栏：程序员文章标签： python excel html

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/mxzsybkj/article/details/138394547

版权

程序员专栏收录该内容

132 篇文章 0 订阅

订阅专栏

python 没有直接处理doc文档的第三方库，但是有一个处理docx的第三方库。可以通过将doc文件转换为docx文件，再调用第三方python库pydocx来读取doc文档的内容。

这里需要注意的是,不要直接修改doc的后缀来修改成docx文件。直接通过修改后缀获取的docx文件，pydocx无法读取内容。

我们可以使用另外一个库来修改doc为docx。

具体代码如下:

代码所需的包接口:

python处理docx文档的方法有很多种，具体使用情况，根据个人需求来决定。

No.1 解压docx文件

docx文件的原理，本质上就是一个压缩的zip文件，通过解压以后，就可以获取原来文件的各个内容。

docx解压后的文件结构如下:

docx文件的文本内容存储结构如下:

文本内容存储于word/document.xml文件中。

第一种方法，我们就可以先将docx还原成zip压缩文件，再解压zip文件，读取word/document.xml文件的内容就ok了。

具体操作代码如下:

最后获取到的就是docx文档的所有文本数据了。

No.2 将docx文档转换成python能够处理的文本格式

第一种方法，是依据docx文档的原理来获取数据,流程有点繁琐，有没有能直接读取docx文档内容的方法呢？答案，肯定是没有的，别想了，洗洗回家睡吧。

直接读取docx文档的方法没有，有没有能够将docx文档转换成python能够轻松处理的文本格式呢？

这个可以有，前面说了，python拥有大量丰富的第三方库（先夸一波我大python）,历经千辛万苦终于找到了，一个能转换docx文档格式的第三方库,pydocx,pydocx库中有个方法pydocx.to_html()就可以直接将docx文档转换为html文件，怎么样？意不意外，惊喜不惊喜！

第二种方法，转换文本格式的代码如下:

获取到的response是html文件内容。

四、Python处理mht文件

mht文件是一种只能在IE浏览器上展示的文本格式，在chrome浏览器中打开是一堆的乱码。

No.1 伪造IE请求mht文件内容

最基础的读取mht文本的方法就是伪造IE浏览器请求。

调用requests库，发送get请求网页链接，构造IE的请求头信息。

理论上来说，这种方法是可行的。但是呢，不建议用，原因大家都懂得。

No.2 转换文件格式

好了说正经的方法，猜测mht文件能否修改成其他文件格式来直接读取呢？

docx,不行；html，不行；excel，更不用说了。

真相只有一个！！！

直接修改后缀得到的docx，无法读取。

so,我们想到的方法是什么呢。没错，就是修改成doc文档。

方法是匪夷所思的，但也是灵感一现。

最后

Python崛起并且风靡，因为优点多、应用领域广、被大牛们认可。学习 Python 门槛很低，但它的晋级路线很多，通过它你能进入机器学习、数据挖掘、大数据，CS等更加高级的领域。Python可以做网络应用，可以做科学计算，数据分析，可以做网络爬虫，可以做机器学习、自然语言处理、可以写游戏、可以做桌面应用…Python可以做的很多，你需要学好基础，再选择明确的方向。这里给大家分享一份全套的 Python 学习资料，给那些想学习 Python 的小伙伴们一点帮助！

👉Python所有方向的学习路线👈

Python所有方向的技术点做的整理，形成各个领域的知识点汇总，它的用处就在于，你可以按照上面的知识点去找对应的学习资源，保证自己学得较为全面。

👉Python必备开发工具👈

工欲善其事必先利其器。学习Python常用的开发软件都在这里了，给大家节省了很多时间。

👉Python全套学习视频👈

我们在看视频学习的时候，不能光动眼动脑不动手，比较科学的学习方法是在理解之后运用它们，这时候练手项目就很适合了。

👉实战案例👈

学python就与学数学一样，是不能只看书不做题的，直接看步骤和答案会让人误以为自己全都掌握了，但是碰到生题的时候还是会一筹莫展。

因此在学习python的过程中一定要记得多动手写代码，教程只需要看一两遍即可。

👉大厂面试真题👈

我们学习Python必然是为了找到高薪的工作，下面这些面试题是来自阿里、腾讯、字节等一线互联网大厂最新的面试资料，并且有阿里大佬给出了权威的解答，刷完这一套面试资料相信大家都能找到满意的工作。

需要这份系统化学习资料的朋友，可以戳这里无偿获取

一个人可以走的很快，但一群人才能走的更远！不论你是正从事IT行业的老鸟或是对IT行业感兴趣的新人，都欢迎加入我们的的圈子（技术交流、学习资源、职场吐槽、大厂内推、面试辅导），让我们一起学习成长！

乐于分享小码农

关注

23
点赞
踩
10

收藏

觉得还不错? 一键收藏
0
评论
Python 读取各类文件格式的文本信息 doc,excel,html,mht_python 文件格式获取(3)

Python崛起并且风靡，因为优点多、应用领域广、被大牛们认可。学习 Python 门槛很低，但它的晋级路线很多，通过它你能进入机器学习、数据挖掘、大数据，CS等更加高级的领域。Python可以做网络应用，可以做科学计算，数据分析，可以做网络爬虫，可以做机器学习、自然语言处理、可以写游戏、可以做桌面应用…Python可以做的很多，你需要学好基础，再选择明确的方向。这里给大家分享一份全套的 Python 学习资料，给那些想学习 Python 的小伙伴们一点帮助！
复制链接

扫一扫

专栏目录

乐于分享小码农 CSDN认证博客专家 CSDN认证企业博客

码龄1年

147: 原创

26万+: 周排名

1万+: 总排名

9万+: 访问

: 等级

3432: 积分

1477: 粉丝

1936: 获赞

9: 评论

1865: 收藏

私信

关注

热门文章

分类专栏

作者\/ 3篇
程序员 132篇

最新评论

早看少被坑！每个学习Python的需要经历的问题_pycharm使用教程 -推广 --推广链接
普通网友: 优质好文，细节很到位！【我也写了一些相关领域的文章，希望能够得到博主的指导，共同进步！】
ActiveMQ应用
CSDN-Ada助手: 恭喜您写了第四篇博客，看来您对ActiveMQ应用有着深入的了解呢！希望您能继续保持创作的热情和努力，不断分享您的经验和见解。或许下一步可以考虑深入探讨ActiveMQ的高级应用技巧或者与其他技术的结合，让读者能够更全面地了解这个话题。期待您更多精彩的文章！如何快速涨粉，请看该博主的分享：https://hope-wisdom.blog.csdn.net/article/details/130544967?utm_source=csdn_ai_ada_blog_reply5
ActiveMQ应用
Y小夜: 这篇文章结构合理，衔接自然紧凑，看完之后确实让我学习到了不少东西，是一篇优质的技术分享文章。三连了！
ActiveMQ应用
The-Venus: 非常喜欢这篇博客！博主的写作风格简洁明了，让人一目了然。文章内容丰富，涵盖了很多实用的知识点，对我来说非常有帮助。尤其是博主在文章中提供了很多实际操作的步骤和技巧，让我能够更好地应用所学的知识。同时，博主的配图也很精美，更加生动地展示了文章中的内容。总之，非常感谢博主的分享，期待博主能够继续输出这样优质的好文。
2024JAVA面试重点问题
CSDN-Ada助手: 非常感谢您分享这篇关于Mybatis学习笔记的博客！看到您对Alibaba的敬仰和对学习的认真态度，让人感到非常钦佩。除了Mybatis，您可能还想了解一下Alibaba的其他开源项目，比如Dubbo和RocketMQ等，这些都是非常热门的技术，也值得深入学习。希望您能继续保持对技术的热情，不断努力，加油！如何写出更高质量的博客，请看该博主的分享：https://blog.csdn.net/lmy_520/article/details/128686434?utm_source=csdn_ai_ada_blog_reply2

最新文章

2024

目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。