DBL:代码中的Darknetconv2d_BN_Leaky,是yolo_v3的基本组件。就是卷积+BN+Leaky relu。
resn:n代表数字,有res1,res2, … ,res8等等,表示这个res_block里含有多少个res_unit。
concat:张量拼接。将darknet中间层和后面的某一层的上采样进行拼接。拼接的操作和残差层add的操作是不一样的,拼接会扩充张量的维度,而add只是直接相加不会导致张量维度的改变。
上述参考原文链接:https://blog.csdn.net/litt1e/article/details/88907542
改进点1--anchor聚类,9种:
改进点2--多尺度预测:
作者在3条预测支路采用全卷积的结构,其中最后一个卷积层的卷积核个数是255,是针对COCO数据集的80类:3*(80+4+1)=255,3表示一个grid cell包含3个bounding box,4表示框的4个坐标信息,1表示objectness score。
从图6.7中可以看到, YOLO v3输出了3个大小不同的特征图, 从上到下分别对应深层、 中层与浅层的特征。 深层的特征图尺寸小, 感受野大, 有利于检测大尺度物体, 而浅层的特征图则与之相反, 更便于检测小尺度物体, 这一点类似于FPN结构。