Python3.9 PDFMiner3k提取PDF为txt文档

我是指针q

于 2022-07-13 00:18:34 发布

阅读量952

点赞数 3

分类专栏： python 文章标签： python 开发语言

本文链接：https://blog.csdn.net/qq_45622493/article/details/125754697

版权

记录下在使用PDFMiner3k时遇到的问题
这里是博主
点击链接查看

 
import urllib
import importlib,sys
importlib.reload(sys)
from pdfminer.pdfparser import PDFParser, PDFDocument
from pdfminer.pdfdevice import PDFDevice
from pdfminer.pdfinterp import PDFResourceManager, PDFPageInterpreter
from pdfminer.converter import PDFPageAggregator
from pdfminer.layout import LTTextBoxHorizontal, LAParams
from pdfminer.pdfinterp import PDFTextExtractionNotAllowed
 
 
def parse(DataIO, save_path):
 
    #用文件对象创建一个PDF文档分析器
    parser = PDFParser(DataIO)
    #创建一个PDF文档
    doc = PDFDocument()
    #分析器和文档相互连接
    parser.set_document(doc)
    doc.set_parser(parser)
    #提供初始化密码，没有默认为空
    doc.initialize()
    #检查文档是否可以转成TXT，如果不可以就忽略
    if not doc.is_extractable:
        raise PDFTextExtractionNotAllowed
    else: