用python实现pdf转txt_Python实现pdf文档转txt的方法示例

最新推荐文章于 2023-11-08 17:31:48 发布

生活教会我们

最新推荐文章于 2023-11-08 17:31:48 发布

阅读量1k

点赞数

文章标签：用python实现pdf转txt

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_35813209/article/details/114030187

版权

本文实例讲述了Python实现pdf文档转txt的方法。分享给大家供大家参考，具体如下：

首先，这是一个比较粗糙的版本，因为已经够用了，而且对pdf的格式不熟悉，所以暂时没有进一步优化。

还有，这是转成txt的，所以如果是有图片的pdf是无法保存图片的。

至于本来就是图片的文本，这里是无法分析出来的。那些图片的pdf，估计要用图形匹配的方式来处理，类似于超速拍摄的车牌识别。

不过这样的程度，已经不是文本处理了。扯远了。。。

转出来的文字，好像按照pdf里面的所展示的来换行了，看不到有什么规则还原，我也不知道怎么处理，将就着用吧。

另外，初始代码是网上找的，最初地址不知道哪里了。

用到了第三方库pdfminier

pdfminer库的地址 https://pypi.python.org/pypi/pdfminer3k

下载后，用cmd执行命令 setup.py install

安装完之后打开eclipse会弹出要求加载一些东西，点击确定就行了。

再来看看代码：

import os.path

from pdfminer.pdfparser import PDFParser,PDFDocument

from pdfminer.pdfinterp import PDFResourceManager, PDFPageInterpreter

from pdfminer.converter import PDFPageAggregator

from pdfminer.layout import LTTextBoxHorizontal,LAP

最低0.47元/天解锁文章

生活教会我们

关注

0
点赞
踩
3

收藏

觉得还不错? 一键收藏
0
评论
用python实现pdf转txt_Python实现pdf文档转txt的方法示例

本文实例讲述了Python实现pdf文档转txt的方法。分享给大家供大家参考，具体如下：首先，这是一个比较粗糙的版本，因为已经够用了，而且对pdf的格式不熟悉，所以暂时没有进一步优化。还有，这是转成txt的，所以如果是有图片的pdf是无法保存图片的。至于本来就是图片的文本，这里是无法分析出来的。那些图片的pdf，估计要用图形匹配的方式来处理，类似于超速拍摄的车牌识别。不过这样的程度，已经不是文本处...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。