DBNet实战：详解DBNet训练与测试（pytorch），砥砺前行

2401_84024576

于 2024-04-04 03:05:50 发布

阅读量939

点赞数 24

分类专栏： 2024年程序员学习文章标签： pytorch 人工智能 python

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/2401_84024576/article/details/137362973

版权

2024年程序员学习专栏收录该内容

236 篇文章 0 订阅

订阅专栏

github链接：github.com

网络结构

===============================================================

首先，图像输入特征提取主干，提取特征；
其次，特征金字塔上采样到相同的尺寸，并进行特征级联得到特征F；
然后，特征F用于预测概率图（probability map P）和阈值图(threshold map T)
最后，通过P和F计算近似二值图（approximate binary map B）

在训练期间对P，T，B进行监督训练，P和B是用的相同的监督信号(label)。在推理时，只需要P或B就可以得到文本框。

网络输出：

1、probability map, wh1 , 代表像素点是文本的概率

2、threshhold map, wh1, 每个像素点的阈值

3、binary map, wh1, 由1,2计算得到，计算公式为DB公式

如下图：

下载代码

===============================================================

从WenmuZhou/DBNet.pytorch: A pytorch re-implementation of Real-time Scene Text Detection with Differentiable Binarization (github.com)获取代码，然后解压。然后安装缺少的安装包

pip install Polygon3 -i https://pypi.tuna.tsinghua.edu.cn/simple

pip install addict

pip install imgaug

根据自己的环境，环境不同，安装的包也不相同。

在pycharm的Terminal下面执行：

python tools/train.py --config_file “config/icdar2015_resnet18_FPN_DBhead_polyLR.yaml”

如果缺少包就会包错误，如果看不到错误，说明都安装了。

数据集

==============================================================

数据集使用icdar2015，网页链接：Downloads - Incidental Scene Text - Robust Reading Competition (uab.es)，需要注册。

选择Task4.1：Text Localization

数据的详细介绍：Tasks - Incidental Scene Text - Robust Reading Competition (uab.es)

任务 4.1：文本本地化对于文本本地化任务，我们将为每个图像提供单词边界框。基本事实作为单独的文本文件（每个图像一个）给出，其中每一行指定一个单词边界框的坐标及其以逗号分隔格式的转录（参见图 1）。

在这里插入图片描述

对于文本本地化任务，地面实况数据以单词边界框的形式提供。与挑战 1 和 2 不同，边界框在挑战 4 中不是轴定向的，它们由四个角的坐标以顺时针方式指定。对于训练集中的每个图像，将按照命名约定提供一个单独的 UTF-8 文本文件：

gt_[image name].txt

文本文件是逗号分隔的文件，其中每一行将对应于图像中的一个单词，并给出其边界框坐标（四个角，顺时针）及其格式的转录：

x1, y1, x2, y2, x3, y3, x4, y4, transcription

请注意，第八个逗号后面的任何内容都是转录的一部分，并且不使用转义字符。 “不关心”区域在基本事实中以“###”的转录表示。作者将被要求自动定位图像中的文本并返回边界框。结果必须在每个图像的单独文本文件中提交，每行对应于上述格式的边界框（逗号分隔值）。应提交包含所有结果文件的单个压缩（zip 或 rar）文件。如果您的方法无法为图像生成任何结果，您可以包含一个空的结果文件或根本不包含任何文件。与挑战 1 和 2 不同，结果的评估将基于单一的 Intersection-over-Union 标准，阈值为 50%，类似于对象识别和 Pascal VOC 挑战 [1] 中的标准做法。

数据集下载完成后可以得到四个文件，如下图：

将ch4_training_images.zip解压到./datasets\train\img下面。

将ch4_training_localization_transcription_gt.zip解压到./datasets\train\gt下面。

将ch4_test_images.zip解压到./datasets\test\img下面。

将Challenge4_Test_Task1_GT.zip解压到./datasets\test\gt下面。

接下来对数据集做预处理，作者写Ubuntu系统下的处理脚本generate_lists.sh，所以如果用的系统是UBuntu，则执行脚本即可

bash generate_lists.sh

如果是Win10平台则需要写python脚本。新建getdata.py,插入代码：

import os

def get_images(img_path):

‘’’

find image files in data path

:return: list of files found

‘’’

files = []

exts = [‘jpg’, ‘png’, ‘jpeg’, ‘JPG’, ‘PNG’]

for parent, dirnames, filenames in os.walk(img_path):

for filename in filenames:

for ext in exts:

if filename.endswith(ext):

files.append(os.path.join(parent, filename))

break

print(‘Find {} images’.format(len(files)))

return sorted(files)

def get_txts(txt_path):

‘’’

find gt files in data path

:return: list of files found

‘’’

files = []

exts = [‘txt’]

for parent, dirnames, filenames in os.walk(txt_path):

for filename in filenames:

for ext in exts:

if filename.endswith(ext):

files.append(os.path.join(parent, filename))

break

print(‘Find {} txts’.format(len(files)))

return sorted(files)

if name == ‘main’:

import json

img_train_path = ‘./datasets/train/img’

img_test_path = ‘./datasets/test/img’

train_files = get_images(img_train_path)

test_files = get_images(img_test_path)

txt_train_path = ‘./datasets/train/gt’

txt_test_path = ‘./datasets/test/gt’

自我介绍一下，小编13年上海交大毕业，曾经在小公司待过，也去过华为、OPPO等大厂，18年进入阿里一直到现在。

深知大多数Python工程师，想要提升技能，往往是自己摸索成长或者是报班学习，但对于培训机构动则几千的学费，着实压力不小。自己不成体系的自学效果低效又漫长，而且极易碰到天花板技术停滞不前！

因此收集整理了一份《2024年Python开发全套学习资料》，初衷也很简单，就是希望能够帮助到想自学提升又不知道该从何学起的朋友，同时减轻大家的负担。

既有适合小白学习的零基础资料，也有适合3年以上经验的小伙伴深入学习提升的进阶课程，基本涵盖了95%以上Python开发知识点，真正体系化！

由于文件比较大，这里只是将部分目录大纲截图出来，每个节点里面都包含大厂面经、学习笔记、源码讲义、实战项目、讲解视频，并且后续会持续更新

如果你觉得这些内容对你有帮助，可以添加V获取：vip1024c （备注Python）

文末有福利领取哦~

👉一、Python所有方向的学习路线

Python所有方向的技术点做的整理，形成各个领域的知识点汇总，它的用处就在于，你可以按照上面的知识点去找对应的学习资源，保证自己学得较为全面。

👉二、Python必备开发工具

👉三、Python视频合集

观看零基础学习视频，看视频学习是最快捷也是最有效果的方式，跟着视频中老师的思路，从基础到深入，还是很容易入门的。

👉 四、实战案例

光学理论是没用的，要学会跟着一起敲，要动手实操，才能将自己的所学运用到实际当中去，这时候可以搞点实战案例来学习。（文末领读者福利）

👉五、Python练习题

检查学习结果。

👉六、面试资料

我们学习Python必然是为了找到高薪的工作，下面这些面试题是来自阿里、腾讯、字节等一线互联网大厂最新的面试资料，并且有阿里大佬给出了权威的解答，刷完这一套面试资料相信大家都能找到满意的工作。

👉因篇幅有限，仅展示部分资料，这份完整版的Python全套学习资料已经上传

一个人可以走的很快，但一群人才能走的更远。如果你从事以下工作或对以下感兴趣，欢迎戳这里加入程序员的圈子，让我们一起学习成长！

AI人工智能、Android移动开发、AIGC大模型、C C#、Go语言、Java、Linux运维、云计算、MySQL、PMP、网络安全、Python爬虫、UE5、UI设计、Unity3D、Web前端开发、产品经理、车载开发、大数据、鸿蒙、计算机网络、嵌入式物联网、软件测试、数据结构与算法、音视频开发、Flutter、IOS开发、PHP开发、.NET、安卓逆向、云计算

学习资料已经上传

一个人可以走的很快，但一群人才能走的更远。如果你从事以下工作或对以下感兴趣，欢迎戳这里加入程序员的圈子，让我们一起学习成长！

AI人工智能、Android移动开发、AIGC大模型、C C#、Go语言、Java、Linux运维、云计算、MySQL、PMP、网络安全、Python爬虫、UE5、UI设计、Unity3D、Web前端开发、产品经理、车载开发、大数据、鸿蒙、计算机网络、嵌入式物联网、软件测试、数据结构与算法、音视频开发、Flutter、IOS开发、PHP开发、.NET、安卓逆向、云计算

关注

24
点赞
踩
26

收藏

觉得还不错? 一键收藏
0
评论
DBNet实战：详解DBNet训练与测试（pytorch），砥砺前行

网络结构首先，图像输入特征提取主干，提取特征；其次，特征金字塔上采样到相同的尺寸，并进行特征级联得到特征F；然后，特征F用于预测概率图（probability map P）和阈值图(threshold map T)最后，通过P和F计算近似二值图（approximate binary map B）在训练期间对P，T，B进行监督训练，P和B是用的相同的监督信号(label)。在推理时，只需要P或B就可以得到文本框。网络输出：1、probability map, wh1 , 代表像素点是文本的概率。
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。