yolov7网络模块解读

thetffs

于 2024-04-17 12:35:16 发布

阅读量431

点赞数 5

分类专栏：人工智能文章标签： YOLO

本文链接：https://blog.csdn.net/t765833631/article/details/137840721

版权

人工智能专栏收录该内容

5 篇文章 0 订阅

订阅专栏

yolov7模块图

在这里插入图片描述

EMA训练技巧

指数移动平均用来平滑模型训练时权重参数更新的方向。它认为模型参数的梯度跟新方向不仅与当前时刻、同历史数据也要做加权。
Vt = β.Vt-1 + (1-β) * θt
攫取代码片段：

v *= d
v += (1.0 - d) * msd[k].detach()

detach()方法的作用是创建一个新的Tensor，这个Tensor与当前计算图脱离关系。它不会参与到后续的梯度传播中。此外，返回的Tensor与原始Tensor共享相同的数据存储，所以对其中一个的原地修改会影响另一个。

检查输入图像尺寸

输入图像必须与最大下采样尺寸整除

def make_divisible(x, divisor):
	return math.ceil(x / divisor) * divisior
	
new_size = make_divisible(img_size, divisor=32)
if new_size != img_size:
	print("warning")

yolov7.yaml配置文件解析

# parameters
nc: 80  # number of classes
depth_multiple: 1.0  # model depth multiple
width_multiple: 1.0  # layer channel multiple

# anchors
anchors:
  - [12,16, 19,36, 40,28]  # P3/8
  - [36,75, 76,55, 72,146]  # P4/16
  - [142,110, 192,243, 459,401]  # P5/32

# yolov7 backbone
backbone:
  # [from, number, module, args]
  # from:前面的输入来自哪一层
  # number：当前层重复几次
  #【32， 3， 1】【特征图的个数， kernel size， stride】
  [[-1, 1, Conv, [32, 3, 1]],  # 0
      
   [-1, 1, Conv, [64, 3, 2]],  # 1-P1/2 stride=2 相当于下采样      
   [-1, 1, Conv, [64, 3, 1]],
   
   [-1, 1, Conv, [128, 3, 2]],  # 3-P2/4  
   [-1, 1, Conv, [64, 1, 1]],
   [-2, 1, Conv, [64, 1, 1]],
   [-1, 1, Conv, [64, 3, 1]],
   [-1, 1, Conv, [64, 3, 1]],
   [-1, 1, Conv, [64, 3, 1]],
   [-1, 1, Conv, [64, 3, 1]],
   [[-1, -3, -5, -6], 1, Concat, [1]], 这个concat对应模块中E-ELAN
   [-1, 1, Conv, [256, 1, 1]],  # 11
         
   [-1, 1, MP, []],
   [-1, 1, Conv, [128, 1, 1]],
   [-3, 1, Conv, [128, 1, 1]],
   [-1, 1, Conv, [128, 3, 2]],
   [[-1, -3], 1, Concat, [1]],  # 16-P3/8  这个concat对应模块中MPconv， 卷积下采样（stride=2）和maxpooling下采样都做，然后凭借到一起
   [-1, 1, Conv, [128, 1, 1]],
   [-2, 1, Conv, [128, 1, 1]],
   [-1, 1, Conv, [128, 3, 1]],
   [-1, 1, Conv, [128, 3, 1]],
   [-1, 1, Conv, [128, 3, 1]],
   [-1, 1, Conv, [128, 3, 1]],
   [[-1, -3, -5, -6], 1, Concat, [1]],
   [-1, 1, Conv, [512, 1, 1]],  # 24
         
   [-1, 1, MP, []],
   [-1, 1, Conv, [256, 1, 1]],
   [-3, 1, Conv, [256, 1, 1]],
   [-1, 1, Conv, [256, 3, 2]],
   [[-1, -3], 1, Concat, [1]],  # 29-P4/16  
   [-1, 1, Conv, [256, 1, 1]],
   [-2, 1, Conv, [256, 1, 1]],
   [-1, 1, Conv, [256, 3, 1]],
   [-1, 1, Conv, [256, 3, 1]],
   [-1, 1, Conv, [256, 3, 1]],
   [-1, 1, Conv, [256, 3, 1]],
   [[-1, -3, -5, -6], 1, Concat, [1]],
   [-1, 1, Conv, [1024, 1, 1]],  # 37
         
   [-1, 1, MP, []],
   [-1, 1, Conv, [512, 1, 1]],
   [-3, 1, Conv, [512, 1, 1]],
   [-1, 1, Conv, [512, 3, 2]],
   [[-1, -3], 1, Concat, [1]],  # 42-P5/32  
   [-1, 1, Conv, [256, 1, 1]],
   [-2, 1, Conv, [256, 1, 1]],
   [-1, 1, Conv, [256, 3, 1]],
   [-1, 1, Conv, [256, 3, 1]],
   [-1, 1, Conv, [256, 3, 1]],
   [-1, 1, Conv, [256, 3, 1]],
   [[-1, -3, -5, -6], 1, Concat, [1]],
   [-1, 1, Conv, [1024, 1, 1]],  # 50
  ]

# yolov7 head
head:
  [[-1, 1, SPPCSPC, [512]], # 51 从51层开始即为backbone的输出
  
   [-1, 1, Conv, [256, 1, 1]],
   [-1, 1, nn.Upsample, [None, 2, 'nearest']],
   [37, 1, Conv, [256, 1, 1]], # route backbone P4
   [[-1, -2], 1, Concat, [1]],
   
   [-1, 1, Conv, [256, 1, 1]],
   [-2, 1, Conv, [256, 1, 1]],
   [-1, 1, Conv, [128, 3, 1]],
   [-1, 1, Conv, [128, 3, 1]],
   [-1, 1, Conv, [128, 3, 1]],
   [-1, 1, Conv, [128, 3, 1]],
   [[-1, -2, -3, -4, -5, -6], 1, Concat, [1]],
   [-1, 1, Conv, [256, 1, 1]], # 63
   
   [-1, 1, Conv, [128, 1, 1]],
   [-1, 1, nn.Upsample, [None, 2, 'nearest']],
   [24, 1, Conv, [128, 1, 1]], # route backbone P3
   [[-1, -2], 1, Concat, [1]],
   
   [-1, 1, Conv, [128, 1, 1]],
   [-2, 1, Conv, [128, 1, 1]],
   [-1, 1, Conv, [64, 3, 1]],
   [-1, 1, Conv, [64, 3, 1]],
   [-1, 1, Conv, [64, 3, 1]],
   [-1, 1, Conv, [64, 3, 1]],
   [[-1, -2, -3, -4, -5, -6], 1, Concat, [1]],
   [-1, 1, Conv, [128, 1, 1]], # 75
      
   [-1, 1, MP, []],
   [-1, 1, Conv, [128, 1, 1]],
   [-3, 1, Conv, [128, 1, 1]],
   [-1, 1, Conv, [128, 3, 2]],
   [[-1, -3, 63], 1, Concat, [1]],
   
   [-1, 1, Conv, [256, 1, 1]],
   [-2, 1, Conv, [256, 1, 1]],
   [-1, 1, Conv, [128, 3, 1]],
   [-1, 1, Conv, [128, 3, 1]],
   [-1, 1, Conv, [128, 3, 1]],
   [-1, 1, Conv, [128, 3, 1]],
   [[-1, -2, -3, -4, -5, -6], 1, Concat, [1]],
   [-1, 1, Conv, [256, 1, 1]], # 88
      
   [-1, 1, MP, []],
   [-1, 1, Conv, [256, 1, 1]],
   [-3, 1, Conv, [256, 1, 1]],
   [-1, 1, Conv, [256, 3, 2]],
   [[-1, -3, 51], 1, Concat, [1]],
   
   [-1, 1, Conv, [512, 1, 1]],
   [-2, 1, Conv, [512, 1, 1]],
   [-1, 1, Conv, [256, 3, 1]],
   [-1, 1, Conv, [256, 3, 1]],
   [-1, 1, Conv, [256, 3, 1]],
   [-1, 1, Conv, [256, 3, 1]],
   [[-1, -2, -3, -4, -5, -6], 1, Concat, [1]],
   [-1, 1, Conv, [512, 1, 1]], # 101
   
   [75, 1, RepConv, [256, 3, 1]],
   [88, 1, RepConv, [512, 3, 1]],
   [101, 1, RepConv, [1024, 3, 1]],

   [[102,103,104], 1, Detect, [nc, anchors]],   # Detect(P3, P4, P5)
  ]

在这里插入图片描述

SPPCSPC:这个模块在yolov中是比较常见的模块，将输入经过卷积，在进行不同尺寸（5、9、13）的maxpooling后的特征图与下采样前的尺寸的特征图进行拼接。
拼接后的特征图又经过BConv然后与原始的模块输入进行Cat得到新的特征图
这两步操作给人的感觉就是，不知道什么样的操作能得到最好的特征图，所以每条路径都尝试一遍，得到最终的特征图
head 部分可以分成3个部分来看。经过SPPCSPC模块后得到了深层特征信息，大小是20 * 20。它经过upsample并与backbone中的网络层进行拼接得到40 * 40和80 * 80 大小的特征信息
在框②中它又对80 * 80的浅层信息进行下采样并且与框①中的特征图进行拼接，得到4040和20 20的特征图并输出
框③对应yaml’配置文件中，对输出层做RepConv操作，得到最终的输出结果

在这里插入图片描述
RepConv模块在训练阶段和推理阶段的操作式不同的：

train：1*1 卷积、 3 * 3卷积、 BN 做叠加

    def forward(self, inputs):
        if hasattr(self, "rbr_reparam"):
            return self.act(self.rbr_reparam(inputs))

        if self.rbr_identity is None:
            id_out = 0
        else:
            id_out = self.rbr_identity(inputs)
        return self.act(self.rbr_dense(inputs) + self.rbr_1x1(inputs) + id_out)

deploy ：推理阶段需要做重参数化，对训练阶段的三层做权重融合

检测头

在这里插入图片描述
为什么是33？

每个检测头有3个anchor
11: x y w h obj 6cls
3 * 11 = 33

thetffs

关注

5
点赞
踩
12

收藏

觉得还不错? 一键收藏
0
评论
yolov7网络模块解读

指数移动平均用来平滑模型训练时权重参数更新的方向。它认为模型参数的梯度跟新方向不仅与当前时刻、同历史数据也要做加权。detach()方法的作用是创建一个新的Tensor，这个Tensor与当前计算图脱离关系。它不会参与到后续的梯度传播中。此外，返回的Tensor与原始Tensor共享相同的数据存储，所以对其中一个的原地修改会影响另一个。
复制链接

扫一扫

专栏目录