识别pdf标题并重命名pdf

颦蹙遥寄

已于 2023-12-27 15:46:00 修改

阅读量858

点赞数 10

文章标签： pdf java 前端

于 2023-12-25 21:21:18 首次发布

本文链接：https://blog.csdn.net/weixin_44751432/article/details/135209430

版权

该文章介绍了一个改进的Python脚本，用于识别PDF文件中最大字体的句子，特别关注包含arXiv的标题部分，并解决期刊名可能为最大字体的问题。脚本通过fitz库操作PDF，找到并替换冒号为特殊符号以创建新的文件名。

摘要生成于 C知道，由 DeepSeek-R1 满血版支持，前往体验 >

最新改进版：
https://blog.csdn.net/weixin_44751432/article/details/135247984

已导出为可执行文件
下载链接在评论区
此为改进版
解决了期刊名可能是最大字体的问题：
思路识别字符串的空格＞3则为标题

import os
import PyPDF2

import fitz

def find_largest_font_sentence(pdf_path):
    largest_font_size = 0
    largest_font_sentence = ''
    maxsize=0
    # 打开PDF文件
    document = fitz.open(pdf_path)

    for page_number in range(document.page_count):
        page = document.load_page(page_number)
        blocks = page.get_text("dict")["blocks"]

        for block in blocks:
            if "lines" in block:  # 检查是否存在 lines 字段
                for line in block["lines"]:
                    for span in line["spans"]:
                        if span["size"] > largest_font_size:
                            largest_font_size = span["size"]
                            largest_