在Python中使用PDF：阅读和拆分_fpdf库分割pdf文件

嘻嘻哈哈学编程

于 2024-04-28 04:07:40 发布

阅读量722

点赞数 20

文章标签： python pdf 开发语言

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/m0_61068496/article/details/138264055

版权

本文介绍了如何使用Python中的PyPDF2和PyMuPDF库来处理PDF文件，包括提取文本、图像、拆分PDF以及查找包含特定文本的页面。PyPDF2用于简单的PDF操作，而PyMuPDF提供了更高级的功能，如保持原始文档结构的完整性。此外，还提供了获取相关学习资源的途径。

摘要由CSDN通过智能技术生成

PDFTables：一种商业服务，提供从PDF文档中提取的表格。提供API以便PDFTable可以用作SAAS。

PyX - Python图形包：PyX是一个用于创建PostScript，PDF和SVG文件的Python包。它结合了PostScript绘图模型的抽象和TeX / LaTeX接口。这些基元构建了复杂的任务，例如以发布就绪质量创建2D和3D图。

ReportLab：一个雄心勃勃的工业级图书馆，主要致力于精确创建PDF文档。可作为开源版本以及名为ReportLab PLUS的商业增强版本免费提供。

PyMuPDF（又名“fitz”）：MuPDF的Python绑定，它是一个轻量级的PDF和XPS查看器。该库可以访问PDF，XPS，OpenXPS，epub，漫画和小说书籍格式的文件，并以其顶级性能和高渲染质量而闻名。

pdfrw：一种基于Python的纯PDF解析器，用于读写PDF。它忠实地再现了矢量格式而没有光栅化。与ReportLab结合使用，有助于在使用ReportLab创建的新PDF中重复使用现有PDF的部分内容。

下面我们将重点介绍PyPDF2和PyMuPDF，并解释如何以最简单的方式提取文本和图像。为了理解PyPDF2的用法，官方文档和其他资源提供的大量示例的组合。相比之下，官方的PyMuPDF文档更清晰，使用库的速度要快得多。

用PyPDF2提取文档

PyPDF2可以作为常规软件包安装，也可以使用pip3（适用于Python3）安装。这里的测试基于即将推出的D

最低0.47元/天解锁文章

嘻嘻哈哈学编程

关注

20
点赞
踩
20

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。