python 读取各类文件格式的文本信息:doc,html,mht,excel

最新推荐文章于 2024-07-29 02:32:41 发布

北房有佳人

最新推荐文章于 2024-07-29 02:32:41 发布

阅读量9.1k

点赞数 4

分类专栏：手写功能文章标签： python读取doc文档 python读取mht python读取excel python读取html

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/mygodit/article/details/90515039

版权

引言

众所周知,python最强大的地方在于，python社区汇总拥有丰富的第三方库，开源的特性，使得有越来越多的技术开发者来完善

python的完美性。

未来人工智能，大数据方向，区块链的识别和进阶都将以python为中心来展开。

咳咳咳！好像有点打广告的嫌疑了。

当前互联网信息共享时代，最重要的是什么?是数据。最有价值的是什么？是数据。最能直观体现技术水平的是什么?还是数据。

所以，今天我们要分享的是：如何来获取各个文件格式的文本信息。

普通文件的格式一般分为: txt普通文本信息，doc word文档，html网页内容，excel表格数据，以及特殊的mht文件。

一，python处理html网页信息。

html类型的文本数据，内容是由前端代码书写的标签+文本数据的格式，可以直接在chrome浏览器打开，清楚的展示出文本的格式。

python 获取html文件的内容和获取txt文件的方法相同，直接打开文件读取就可以了。

读取代码如下:

 with open(html_path, "r", encoding="utf-8") as f:
            file = f.read()

file 是html文件的文本内容。是一个网页标签的格式内容。

二，python处理excel表格信息。

python拥有直接操作excel表格的第三

最低0.47元/天解锁文章

北房有佳人

关注

4
点赞
踩
37

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。