Paddle-ocr pdf-to-word操作指南

kjzd123

已于 2024-05-07 11:16:11 修改

阅读量2.3k

点赞数 5

文章标签：人工智能 python transformer 深度学习

于 2024-05-07 10:44:31 首次发布

本文链接：https://blog.csdn.net/kjzd123/article/details/138521229

版权

1. 安装

1.1 安装PaddlePaddle

您的机器安装的是CUDA9或CUDA10，请运行以下命令安装

python3 -m pip install paddlepaddle-gpu -i https://mirror.baidu.com/pypi/simple

您的机器是CPU，请运行以下命令安装

python3 -m pip install paddlepaddle -i https://mirror.baidu.com/pypi/simple

更多的版本需求，请参照飞桨官网安装文档中的说明进行操作。

1.2 安装PaddleOCR whl包
pip install “paddleocr>=2.0.1” # 推荐使用2.0.1+版本
对于Windows环境用户：直接通过pip安装的shapely库可能出现[winRrror 126] 找不到指定模块的问题。建议从这里下载shapely安装包完成安装。

2 下载代码

git clone https://github.com/PaddlePaddle/PaddleOCR.git

3. 两种方式实现pdf to word

3.1 使用提供的代码实现转换

1.使用这个网站PDF转化将pdf文件拆分成若干个单个pdf页

运行这个python文件

python ppstructure/pdf2word/pdf2word.py

2.得到输入的word文档使用一下代码将多个word文档合成一个word文档

import os
from docx import Document

def merge_docx_from_folder(folder_path, output_file):
    # 创建一个空白的目标文档
    merged_doc = Document()

    # 遍历指定文件夹中的所有文件
    for filename in os.listdir(folder_path):
        if filename.endswith(".docx"):
            # 构造完整的文件路径
            file_path = os.path.join(folder_path, filename)

            # 打开当前的 Word 文件
            doc = Document(file_path)

            # 遍历当前 Word 文件的每个段落，并逐段复制到目标文档
            for para in doc.paragraphs:
                merged_doc.add_paragraph(para.text)

            # 添加分页符，区分不同文件的内容
            merged_doc.add_page_break()

    # 保存合并后的文档
    merged_doc.save(output_file)

# 指定要合并的文件夹路径和输出文件名
folder_path = r"E:\graduate\work\haohanshendu\work\code\ocr_for_transcribing_pdf_slides-main\input_images\output"
output_file = "merged_output.docx"

# 调用函数执行合并操作
merge_docx_from_folder(folder_path, output_file)