python提取pdf表格数据并保存到excel中

最新推荐文章于 2024-08-14 21:16:44 发布

置顶

一位代码

最新推荐文章于 2024-08-14 21:16:44 发布

阅读量6.9k

点赞数 16

分类专栏： python 文章标签： python

本文链接：https://blog.csdn.net/LHJCSDNYL/article/details/124207996

版权

pdfplumber操作pdf文件

python开源库pdfplumber，可以较为方便地获取pdf的各种信息，包含pdf的基本信息（作者、创建时间、修改时间…）及表格、文本、图片等信息，基本可以满足较为简单的格式转换功能。
一、pdfplumber安装及导入
跟其他包一样，支持使用pip安装，安装命令：

pip install pdfplumber

在这里插入图片描述
安装成功后，可直接用import导入，导入命令：

import pdfplumber

二、pdfplumber基础使用
1、基础知识
（1）pdfplumber有2个基础类
PDF和Page，PDF用来处理整个文档，Page用来处理整个页面。

类	用法简介
pdfplumber.PDF	.metadata，获取pdf基础信息，返回字典格式，包含作者、创建时间等。 .pages，返回pdfplumber.Page实例的列表，每一个实例包含pdf每一页的信息
pdfplumber.Page	pdfplumber核心功能，对PDF的大部分操作都是基于这个类，包括提取文本、表格等

（2）pdfplumber读取pdf文件方式

pdfplumber.open(‘文件路径’)，返回pdfplumber.PDF类的实例。
如果pdf有密码，加入password参数：
pdfplumber.open(‘文件路径’,password=‘密码’)

2、获取pdf基础信息

读取pdf文件，并输出pdf文件的基础信息

import pdfplumber
# 打开pdf文件，有密码加入password参数
pdf_info =pdfplumber.open(r'test.pdf')
meta_data = pdf_info.metadata  # pdf的基础信息
page_con = len(pdf_info.pages)  # 获取pdf的总页数
print('pdf文件的基础信息：\n', meta_data)
print('pdf共%s页' % page_con)