探索分析文档布局，基于YOLOv3全系列【yolov3tiny/yolov3/yolov3spp】参数模型开发构建大规模文档数据集DocLayNet场景下文档图像布局智能检测分析识别系统

本文链接：https://blog.csdn.net/Together_CZ/article/details/141630896

随着数字化和信息化的快速发展，大量的文档（如合同、报告、表格、发票等）以电子形式存在，这些文档中包含了丰富的信息。然而，这些信息往往以非结构化的形式存在，难以直接被计算机程序理解和处理。文档布局分析任务的目的就是将这些非结构化的文档转换为结构化的数据，从而使得计算机能够自动地理解、分类、检索和处理这些文档中的信息。

为了推动文档布局分析技术的发展，需要一个大规模、多样性、高质量的数据集来训练和评估模型。DocLayNet数据集的构建正是出于以下几个需要：

模型训练：大规模的数据集可以为模型训练提供丰富的数据资源，帮助模型学习到更复杂的文档布局特征。

模型评估：高质量的数据集可以用于模型的评估，确保模型的性能和泛化能力。

技术研究：多样性的数据集可以支持多种文档布局分析技术的研究，推动技术的创新和发展。

应用开发：数据集的构建为开发实际应用提供了基础，如自动文档处理系统、信息提取工具等。

DocLayNet是一个大规模的数据集，专门用于文档布局分析任务。该数据集由德国人工智能研究中心（DFKI）和萨尔大学联合开发，旨在推动文档理解技术的发展。DocLayNet数据集包含了多种类型的文档，如合同、表格、发票、简历等，总计超过10万页的文档图像。

【数据集特点】
多样性：DocLayNet包含了多种类型的文档，涵盖了广泛的领域和格式，确保了数据集的多样性和实用性。
大规模：数据集包含超过10万页的文档图像，为模型训练提供了丰富的数据资源。
高质量标注：每页文档都经过了详细的标注，包括文本区域、表格、图像、标题、段落等元素的位置和类别信息。
多语言支持：数据集中的文档包含了多种语言，有助于模型在多语言环境下的泛化能力。


【数据格式】
DocLayNet数据集的标注信息以JSON格式提供，每个文档的标注文件包含了以下信息：
页面信息：每个页面的尺寸、分辨率等基本信息。
区域标注：每个页面上的不同区域（如文本、表格、图像等）的位置和类别信息。
文本内容：每个文本区域的具体文本内容（可选）。


【应用场景】
DocLayNet数据集主要用于以下几个方面的研究和应用：
文档布局分析：识别和理解文档中的不同布局元素，如文本、表格、图像等。
文档分类：根据文档的布局和内容，对文档进行分类。
信息提取：从文档中提取特定信息，如合同中的条款、发票中的金额等。
文档理解：通过分析文档的布局和内容，理解文档的整体结构和含义。

本文的主要目的就是想要基于大规模文档布局分析数据集DocLayNet来尝试开发构建相应的目标检测分析系统，在前文我们已经有了相关的开发实践感兴趣的话可以自行移步阅读即可：

《探索分析文档布局，基于YOLOv8全系列【n/s/m/l/x】参数模型开发构建大规模文档数据集DocLayNet场景下文档图像布局智能检测分析识别系统》

YOLOv8可以说是YOLO系列里程碑的强大代表，本文考虑的是想要使用YOLO系列真正开创者YOLOv3来进行开发实践，首先看下实例效果：

数据实例如下所示：

本文是选择的比较经典的也是比较古老的YOLOv3来进行模型的开发，YOLOv3（You Only Look Once v3）是一种目标检测算法模型，它是YOLO系列算法的第三个版本。该算法通过将目标检测任务转化为单个神经网络的回归问题，实现了实时目标检测的能力。

YOLOv3的主要优点如下：

实时性能：YOLOv3采用了一种单阶段的检测方法，将目标检测任务转化为一个端到端的回归问题，因此具有较快的检测速度。相比于传统的两阶段方法（如Faster R-CNN），YOLOv3能够在保持较高准确率的情况下实现实时检测。

多尺度特征融合：YOLOv3引入了多尺度特征融合的机制，通过在不同层级的特征图上进行检测，能够有效地检测不同尺度的目标。这使得YOLOv3在处理尺度变化较大的场景时表现出较好的性能。

全局上下文信息：YOLOv3在网络结构中引入了全局上下文信息，通过使用较大感受野的卷积核，能够更好地理解整张图像的语义信息，提高了模型对目标的识别能力。

简洁的网络结构：YOLOv3的网络结构相对简洁，只有75个卷积层和5个池化层，使得模型较易于训练和部署，并且具有较小的模型体积。

YOLOv3也存在一些缺点：

较低的小目标检测能力：由于YOLOv3采用了较大的感受野和下采样操作，对于小目标的检测能力相对较弱。当场景中存在大量小目标时，YOLOv3可能会出现漏检或误检的情况。

较高的定位误差：由于YOLOv3将目标检测任务转化为回归问题，较粗糙的特征图和较大的感受野可能导致较高的定位误差。这意味着YOLOv3在需要较高精度的目标定位时可能会受到一定的限制。

YOLOv3是YOLO系列里程碑性质的模型，随着不断地演变和发展，目前虽然已经在性能上难以与YOLOv5之类的模型对比但是不可否认其做出的突出贡献。

训练数据配置文件如下所示：

# path
train: ./dataset/images/train/
val: ./dataset/images/test/


# number of classes
nc: 11

 
# class names
names: ['Caption', 'Footnote', 'Formula', 'ListItem', 'PageFooter', 'PageHeader', 'Picture', 'SectionHeader', 'Table', 'Text', 'Title']

我们开发构建了yolov3全系列的参数模型，包含：yolov3-tiny、yolov3和yolov3-spp，实验阶段保持完全相同的参数设置，等待整体实验完成我们来对其进行整体的性能评估测试。

【Precision曲线】
精确率曲线（Precision Curve）是一种用于评估二分类模型在不同阈值下的精确率性能的可视化工具。它通过绘制不同阈值下的精确率和召回率之间的关系图来帮助我们了解模型在不同阈值下的表现。
精确率（Precision）是指被正确预测为正例的样本数占所有预测为正例的样本数的比例。召回率（Recall）是指被正确预测为正例的样本数占所有实际为正例的样本数的比例。
绘制精确率曲线的步骤如下：
使用不同的阈值将预测概率转换为二进制类别标签。通常，当预测概率大于阈值时，样本被分类为正例，否则分类为负例。
对于每个阈值，计算相应的精确率和召回率。
将每个阈值下的精确率和召回率绘制在同一个图表上，形成精确率曲线。
根据精确率曲线的形状和变化趋势，可以选择适当的阈值以达到所需的性能要求。
通过观察精确率曲线，我们可以根据需求确定最佳的阈值，以平衡精确率和召回率。较高的精确率意味着较少的误报，而较高的召回率则表示较少的漏报。根据具体的业务需求和成本权衡，可以在曲线上选择合适的操作点或阈值。
精确率曲线通常与召回率曲线（Recall Curve）一起使用，以提供更全面的分类器性能分析，并帮助评估和比较不同模型的性能。

【Recall曲线】
召回率曲线（Recall Curve）是一种用于评估二分类模型在不同阈值下的召回率性能的可视化工具。它通过绘制不同阈值下的召回率和对应的精确率之间的关系图来帮助我们了解模型在不同阈值下的表现。
召回率（Recall）是指被正确预测为正例的样本数占所有实际为正例的样本数的比例。召回率也被称为灵敏度（Sensitivity）或真正例率（True Positive Rate）。
绘制召回率曲线的步骤如下：
使用不同的阈值将预测概率转换为二进制类别标签。通常，当预测概率大于阈值时，样本被分类为正例，否则分类为负例。
对于每个阈值，计算相应的召回率和对应的精确率。
将每个阈值下的召回率和精确率绘制在同一个图表上，形成召回率曲线。
根据召回率曲线的形状和变化趋势，可以选择适当的阈值以达到所需的性能要求。
通过观察召回率曲线，我们可以根据需求确定最佳的阈值，以平衡召回率和精确率。较高的召回率表示较少的漏报，而较高的精确率意味着较少的误报。根据具体的业务需求和成本权衡，可以在曲线上选择合适的操作点或阈值。
召回率曲线通常与精确率曲线（Precision Curve）一起使用，以提供更全面的分类器性能分析，并帮助评估和比较不同模型的性能。

【loss曲线】

在深度学习的训练过程中，loss函数用于衡量模型预测结果与实际标签之间的差异。loss曲线则是通过记录每个epoch（或者迭代步数）的loss值，并将其以图形化的方式展现出来，以便我们更好地理解和分析模型的训练过程。

【mAP0.5】
mAP0.5，也被称为mAP@0.5或AP50，指的是当Intersection over Union（IoU）阈值为0.5时的平均精度（mean Average Precision）。IoU是一个用于衡量预测边界框与真实边界框之间重叠程度的指标，其值范围在0到1之间。当IoU值为0.5时，意味着预测框与真实框至少有50%的重叠部分。
在计算mAP0.5时，首先会为每个类别计算所有图片的AP（Average Precision），然后将所有类别的AP值求平均，得到mAP0.5。AP是Precision-Recall Curve曲线下面的面积，这个面积越大，说明AP的值越大，类别的检测精度就越高。
mAP0.5主要关注模型在IoU阈值为0.5时的性能，当mAP0.5的值很高时，说明算法能够准确检测到物体的位置，并且将其与真实标注框的IoU值超过了阈值0.5。

【mAP0.5:0.95】
mAP0.5:0.95，也被称为mAP@[0.5:0.95]或AP@[0.5:0.95]，表示在IoU阈值从0.5到0.95变化时，取各个阈值对应的mAP的平均值。具体来说，它会在IoU阈值从0.5开始，以0.05为步长，逐步增加到0.95，并在每个阈值下计算mAP，然后将这些mAP值求平均。
这个指标考虑了多个IoU阈值下的平均精度，从而更全面、更准确地评估模型性能。当mAP0.5:0.95的值很高时，说明算法在不同阈值下的检测结果均非常准确，覆盖面广，可以适应不同的场景和应用需求。
对于一些需求比较高的场合，比如安全监控等领域，需要保证高的准确率和召回率，这时mAP0.5:0.95可能更适合作为模型的评价标准。
综上所述，mAP0.5和mAP0.5:0.95都是用于评估目标检测模型性能的重要指标，但它们的关注点有所不同。mAP0.5主要关注模型在IoU阈值为0.5时的性能，而mAP0.5:0.95则考虑了多个IoU阈值下的平均精度，从而更全面、更准确地评估模型性能。

【F1值曲线】
F1值曲线是一种用于评估二分类模型在不同阈值下的性能的可视化工具。它通过绘制不同阈值下的精确率（Precision）、召回率（Recall）和F1分数的关系图来帮助我们理解模型的整体性能。
F1分数是精确率和召回率的调和平均值，它综合考虑了两者的性能指标。F1值曲线可以帮助我们确定在不同精确率和召回率之间找到一个平衡点，以选择最佳的阈值。
绘制F1值曲线的步骤如下：
使用不同的阈值将预测概率转换为二进制类别标签。通常，当预测概率大于阈值时，样本被分类为正例，否则分类为负例。
对于每个阈值，计算相应的精确率、召回率和F1分数。
将每个阈值下的精确率、召回率和F1分数绘制在同一个图表上，形成F1值曲线。
根据F1值曲线的形状和变化趋势，可以选择适当的阈值以达到所需的性能要求。
F1值曲线通常与接收者操作特征曲线（ROC曲线）一起使用，以帮助评估和比较不同模型的性能。它们提供了更全面的分类器性能分析，可以根据具体应用场景来选择合适的模型和阈值设置。

从整体实验结果上来看：三款不同参数系列的模型没有拉开非常明显的差距，tiny系列模型效果略差，YOLOv3和YOLOv3-SPP则达到了相近的水准，综合考虑模型参数量这里最终选择使用yolov3来作为线上推理模型。接下来详细看下yolov3模型的结果详情。

【离线推理实例如下】

【Batch实例】

【混淆矩阵】

【PR曲线】

【训练可视化】

文档布局分析任务的背景意义在于将非结构化的文档转换为结构化的数据，从而实现文档的自动理解和处理。DocLayNet数据集的构建正是为了满足这一需求，提供一个大规模、多样性、高质量的数据集，推动文档布局分析技术的发展和应用。通过使用DocLayNet数据集，我们可以训练和评估文档布局分析模型，开发出更高效、更准确的文档处理系统。感兴趣的话也可以对应开发自己的文档布局分析系统。