python 打开pdf文件_Python实现PDF转Word文档

最新推荐文章于 2024-02-27 15:45:38 发布

weixin_39572316

最新推荐文章于 2024-02-27 15:45:38 发布

阅读量169

点赞数

文章标签： python 打开pdf文件

所需模块

pdfminer3k

python-docx

读取PDF

100

写入Word

100

移除32以下的字符

100

最终代码

import os

from configparser import ConfigParser

from io import StringIO

from io import open

from concurrent.futures import ProcessPoolExecutor

from pdfminer.pdfinterp import PDFResourceManager

from pdfminer.pdfinterp import process_pdf

from pdfminer.converter import TextConverter

from pdfminer.layout import LAParams

from docx import Document

def read_from_pdf(file_path):

with open(file_path, 'rb') as file:

resource_manager = PDFResourceManager()

return_str = StringIO()

lap_params = LAParams()

device = TextConverter(

resource_manager, return_str, laparams=lap_params)

process_pdf(resource_manager, device, file)

device.close()

content = return_str.getvalue()

return_str.close()

return content

def save_text_to_word(content, file_path):

doc = Document()

for line in content.split('\n'):

paragraph = doc.add_paragraph()

paragraph.add_run(remove_control_characters(line))

doc.save(file_path)

def remove_control_characters(content):

mpa = dict.fromkeys(range(32))

return content.translate(mpa)

def pdf_to_word(pdf_file_path, word_file_path):

content = read_from_pdf(pdf_file_path)

save_text_to_word(content, word_file_path)

def main():

config_parser = ConfigParser()

config_parser.read('config.cfg')

config = config_parser['default']

tasks = []

with ProcessPoolExecutor(max_workers=int(config['max_worker'])) as executor:

for file in os.listdir(config['pdf_folder']):

extension_name = os.path.splitext(file)[1]

if extension_name != '.pdf':

continue

file_name = os.path.splitext(file)[0]

pdf_file = config['pdf_folder'] + '/' + file

word_file = config['word_folder'] + '/' + file_name + '.docx'

print('正在处理: ', file)

result = executor.submit(pdf_to_word, pdf_file, word_file)

tasks.append(result)

while True:

exit_flag = True

for task in tasks:

if not task.done():

exit_flag = False

if exit_flag:

print('完成')

exit(0)

if __name__ == '__main__':

main()

运行效果

100

100

weixin_39572316

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
python 打开pdf文件_Python实现PDF转Word文档

所需模块pdfminer3kpython-docx读取PDF写入Word移除32以下的字符最终代码import osfrom configparser import ConfigParserfrom io import StringIOfrom io import openfrom concurrent.futures import ProcessPoolExecutorfrom pdfminer...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。