python docx提取word中的目录及文本框中的文本

最新推荐文章于 2025-04-02 14:06:26 发布

SUN_SU3

最新推荐文章于 2025-04-02 14:06:26 发布

阅读量1.6w

点赞数 24

分类专栏：文档处理文章标签： python

本文链接：https://blog.csdn.net/u013546508/article/details/98849695

版权

问题描述

同标题

解决方案

因未在docx库找到直接识别word中目录及文本框中文本的方法，所以采用了一个“笨”方法，docx库可以把word文档解析成xml格式，以解析xml的方式查找目录及文本框中文本，具体做法：
迭代出文档的所有element，其中目录的tag为“std”，找到它后提出他的所有文本即为目录文本；文本框的tag 为“textbox”，找到它后还要继续下钻寻找tag为 'r’的element,提取其文本则为文本框中文本。

# 提取word目录
file = docx.Document(file_path)
children = file.element.body.iter()
child_iters = []
for child in children:
    # 通过类型判断目录
    if child.tag.endswith('main}sdt'):
        for ci in child.iter():
            if ci.text and ci.text.strip():
                child_iters