1. 安装
1.1 安装PaddlePaddle
您的机器安装的是CUDA9或CUDA10,请运行以下命令安装
python3 -m pip install paddlepaddle-gpu -i https://mirror.baidu.com/pypi/simple
您的机器是CPU,请运行以下命令安装
python3 -m pip install paddlepaddle -i https://mirror.baidu.com/pypi/simple
更多的版本需求,请参照飞桨官网安装文档中的说明进行操作。
1.2 安装PaddleOCR whl包
pip install “paddleocr>=2.0.1” # 推荐使用2.0.1+版本
对于Windows环境用户:直接通过pip安装的shapely库可能出现[winRrror 126] 找不到指定模块的问题。建议从这里下载shapely安装包完成安装。
2 下载代码
git clone https://github.com/PaddlePaddle/PaddleOCR.git
3. 两种方式实现pdf to word
3.1 使用提供的代码实现转换
1.使用这个网站PDF转化 将pdf文件 拆分成若干个单个pdf页
运行这个python文件
python ppstructure/pdf2word/pdf2word.py
2.得到输入的word文档 使用一下代码将多个word文档 合成一个word文档
import os
from docx import Document
def merge_docx_from_folder(folder_path, output_file):
# 创建一个空白的目标文档
merged_doc = Document()
# 遍历指定文件夹中的所有文件
for filename in os.listdir(folder_path):
if filename.endswith(".docx"):
# 构造完整的文件路径
file_path = os.path.join(folder_path, filename)
# 打开当前的 Word 文件
doc = Document(file_path)
# 遍历当前 Word 文件的每个段落,并逐段复制到目标文档
for para in doc.paragraphs:
merged_doc.add_paragraph(para.text)
# 添加分页符,区分不同文件的内容
merged_doc.add_page_break()
# 保存合并后的文档
merged_doc.save(output_file)
# 指定要合并的文件夹路径和输出文件名
folder_path = r"E:\graduate\work\haohanshendu\work\code\ocr_for_transcribing_pdf_slides-main\input_images\output"
output_file = "merged_output.docx"
# 调用函数执行合并操作
merge_docx_from_folder(folder_path, output_file)
使用ppstructure/predict_system.py 自定义使用模型 进行转换
运行ppstructure/predict_system.py文件