python pdfplumber用于pdf表格提取

最新推荐文章于 2024-07-23 10:53:38 发布

weixin_34192993

最新推荐文章于 2024-07-23 10:53:38 发布

阅读量6.9k

点赞数 1

文章标签： python 开发工具

 1 import pdfplumber
 2 
 3 with pdfplumber.open('test.pdf') as pdf:
 4     #page_count = len(pdf.pages())
 5     p0 = pdf.pages[0]
 6     # 获取文本，直接得到字符串，包括了换行符【与PDF上的换行位置一致，而不是实际的“段落”】
 7     #print(p0.extract_text()) 
 8     # 获取本页全部表格，也可以使用extract_table()获得单个表格
 9     for table in p0.extract_tables(): 
10         #得到的table是嵌套list类型，转化成DataFrame更加方便查看和分析 
11         for line in table:
12             print(line)
13 
14 #安装ImageMagick，地址在下面            
15 #http://docs.wand-py.org/en/latest/guide/install.html#install-imagemagick-on-windows
16 #https://blog.csdn.net/blmoistawinde/article/details/82051915

关注博主即可阅读全文

确定要放弃本次机会？

福利倒计时

: :

立减 ¥

普通VIP年卡可用

立即使用

weixin_34192993

关注关注

1
点赞
踩
11

收藏

觉得还不错? 一键收藏
2
评论
python pdfplumber用于pdf表格提取

1 import pdfplumber 2 3 with pdfplumber.open('test.pdf') as pdf: 4 #page_count = len(pdf.pages()) 5 p0 = pdf.pages[0] 6 # 获取文本，直接得到字符串，包括了换行符【与PDF上的换行位置一致，而不是实际的“段落”】 7 #print...
复制链接

扫一扫