python读取pdf文档-实战

python基础教程

于 2017-04-09 08:28:14 发布

阅读量4.9k

点赞数

分类专栏： python基础教程

本文链接：https://blog.csdn.net/stopcpp/article/details/69791689

版权

本文将介绍如何使用Python库来读取PDF文档，包括解析内容、提取文本和图像等操作，帮助你掌握Python在PDF处理上的实用技巧。

摘要由CSDN通过智能技术生成

# -*- coding: utf-8 -*-
#读取pdf文档
from pdfminer.converter import PDFPageAggregator
from pdfminer.layout import LAParams
from pdfminer.pdfparser import PDFParser,PDFDocument
from pdfminer.pdfinterp import PDFResourceManager, PDFPageInterpreter
from pdfminer.pdfdevice import PDFDevice
import pdfminer.pdfinterp


#获取文档对象
fp = open("naacl06-shinyama.pdf","rb")
#创建一个与文档关联的解释器
parser=PDFParser(fp)
#PDF文档对象
doc = PDFDocument()