在Python中使用PDF：阅读和拆分_fpdf库分割pdf文件

最新推荐文章于 2024-06-27 16:01:16 发布

m0_61369227

最新推荐文章于 2024-06-27 16:01:16 发布

阅读量613

点赞数 18

文章标签： python pdf 开发语言

本文链接：https://blog.csdn.net/m0_61369227/article/details/139943965

版权

Python相关的PDF工具，模块和库的可用解决方案范围有点令人困惑，需要花一点时间来弄清楚什么是什么，以及哪些项目是持续维护的。根据我们的研究，这些是目前最新的方案：

PyPDF2：这是一个Python库，用于提取文档信息和内容，逐页拆分文档，合并文档，裁剪页面和添加水印。 PyPDF2支持未加密和加密的文档。

PDFMiner：完全用Python编写，适用于Python 2.4。对于Python 3，请使用克隆包PDFMiner.six。这两个包都允许您解析，分析和转换PDF文档。包括对PDF 1.7以及CJK语言（中文，日文和韩文）以及各种字体类型（Type1，TrueType，Type3和CID）的支持。

PDFQuery：它将自己描述为“一个快速且友好的PDF抓取库”，它作为PDFMiner，lxml和pyquery的包装器实现。它的设计目标是“用尽可能少的代码可靠地从PDF集合中提取数据。”

tabula-py：它是tabula-java的简单Python包装器，可以从PDF中读取表并将它们转换为Pandas DataFrames。它还允许您将PDF文件转换为CSV / TSV / JSON文件。

pdflib for Python：Poppler库的扩展，为它提供Python绑定。它允许您解析，分析和转换PDF文档。不要与其同名的商业吊坠相混淆。

PyFPDF：用于在Python下生成PDF文档的库。从FPDF PHP库移植，一个众所周知的PDFlib扩展替换，包含许多示例，脚本和衍生产品。

PDFTables：一种商业服务，提供从PDF文档中提取的表格。提供API以便PDFTable可以用作SAAS。

PyX - Python图形包：PyX是一个用于创建PostScript，PDF和SVG文件的Python包。它结合了PostScript绘图模型的抽象和TeX / LaTeX接口。这些基元构建了复杂的任务，例如以发布就绪质量创建2D和3D图。

ReportLab：一个雄心勃勃的工业级图书馆，主要致力于精确创建PDF文档。可作为开源版本以及名为ReportLab PLUS的商业增强版本免费提供。

PyMuPDF（又名“fitz”）：MuPDF的Python绑定，它是一个轻量级的PDF和XPS查看器。该库可以访问PDF，XPS，OpenXPS，epub，漫画和小说书籍格式的文件，并以其顶级性能和高渲染质量而闻名。

pdfrw：一种基于Python的纯PDF解析器，用于读写PDF。它忠实地再现了矢量格式而没有光栅化。与ReportLab结合使用，有助于在使用ReportLab创建的新PDF中重复使用现有PDF的部分内容。

下面我们将重点介绍PyPDF2和PyMuPDF，并解释如何以最简单的方式提取文本和图像。为了理解PyPDF2的用法，官方文档和其他资源提供的大量示例的组合。相比之下，官方的PyMuPDF文档更清晰，使用库的速度要快得多。

用PyPDF2提取文档

PyPDF2可以作为常规软件包安装，也可以使用pip3（适用于Python3）安装。这里的测试基于即将推出的Debian GNU / Linux版本10“Buster”的软件包。 Debian软件包的名称是python3-pypdf2。

下面的代码首先导入PdfFileReader类，然后适用这个类打开文件，用getDocumentInfo() 方法来提取文档信息，包括页数和首页内容。

请注意PyPDF2页码计数从0开始，这也是为什么pdf.getPage(0)函数可以获取文件的第一页。最终，提取到的信息被打印到了stdout。

使用PyMuPDF提取文本

PyMuPDF可从PyPi网站获得，您可以在终端中使用以下命令安装包：

显示文档信息，打印页数和提取PDF文档的文本的方式与PyPDF2类似（参见清单2）。要导入的模块名为fitz，并返回到PyMuPDF的先前名称。

PyMuPDF的优点在于它保持原始文档结构的完整性 - 带有换行符的整个段落保留在PDF文档中。

使用PyMuPDF从PDF中提取图像

PyMuPDF使用getPageImageList（）方法简化了从PDF文档中提取图像的过程。下面的代码来源于PyMuPDF wiki页面的示例，并逐页提取并保存PDF中的所有图像作为PNG文件。如果图像具有CMYK颜色空间，则首先将其转换为RGB。

在400页PDF上运行这个Python脚本，它在不到3秒的时间内提取了117个图像，这是惊人的。各个图像以PNG格式存储。为了保持原始图像格式和大小，而不是转换为PNG，请查看PyMuPDF wiki中脚本的扩展版本。

使用PyPDF2将PDF拆分为页面

对于此示例，首先需要导入PdfFileReader和PdfFileWriter类。然后我们打开PDF文件，创建一个reader对象，并使用reader对象的getNumPages方法遍历所有页面。

在for循环中，我们创建了一个新的PdfFileWriter实例，它不包含任何页面。然后，我们使用pdfWriter.addPage（）方法将当前页面添加到writer对象。此方法接受页面对象，我们使用PdfFileReader.getPage（）方法获取该页面对象。

下一步是创建一个唯一的文件名，我们使用原始文件名加上“page”一词加上页码。我们在当前页码中加1，因为PyPDF2计算从零开始的页码。

最后，我们以“write binary”模式（模式wb）打开新文件名，并使用pdfWriter类的write（）方法将提取的页面保存到磁盘。

查找包含文本的所有页面

学好 Python 不论是就业还是做副业赚钱都不错，但要学会 Python 还是要有一个学习规划。最后大家分享一份全套的 Python 学习资料，给那些想学习 Python 的小伙伴们一点帮助！

一、Python所有方向的学习路线

Python所有方向路线就是把Python常用的技术点做整理，形成各个领域的知识点汇总，它的用处就在于，你可以按照上面的知识点去找对应的学习资源，保证自己学得较为全面。

二、学习软件

工欲善其事必先利其器。学习Python常用的开发软件都在这里了，给大家节省了很多时间。

三、全套PDF电子书

书籍的好处就在于权威和体系健全，刚开始学习的时候你可以只看视频或者听某个人讲课，但等你学完之后，你觉得你掌握了，这时候建议还是得去看一下书籍，看权威技术书籍也是每个程序员必经之路。

四、入门学习视频

我们在看视频学习的时候，不能光动眼动脑不动手，比较科学的学习方法是在理解之后运用它们，这时候练手项目就很适合了。

五、实战案例

光学理论是没用的，要学会跟着一起敲，要动手实操，才能将自己的所学运用到实际当中去，这时候可以搞点实战案例来学习。

六、面试资料

我们学习Python必然是为了找到高薪的工作，下面这些面试题是来自阿里、腾讯、字节等一线互联网大厂最新的面试资料，并且有阿里大佬给出了权威的解答，刷完这一套面试资料相信大家都能找到满意的工作。

m0_61369227

关注

18
点赞
踩
12

收藏

觉得还不错? 一键收藏
0
评论
在Python中使用PDF：阅读和拆分_fpdf库分割pdf文件

Python相关的PDF工具，模块和库的可用解决方案范围有点令人困惑，需要花一点时间来弄清楚什么是什么，以及哪些项目是持续维护的。根据我们的研究，这些是目前最新的方案：PyPDF2：这是一个Python库，用于提取文档信息和内容，逐页拆分文档，合并文档，裁剪页面和添加水印。PyPDF2支持未加密和加密的文档。PDFMiner：完全用Python编写，适用于Python 2.4。对于Python 3，请使用克隆包PDFMiner.six。这两个包都允许您解析，分析和转换PDF文档。
复制链接

扫一扫