一、论文理论
1.理论思想
改进1:在融合块中将3×3卷积层替换为1×1卷积层
在融合模块中替换3×3卷积层存在两个主要动机。首先,融合独立于特征图中其他位置的局部和全局特征,以简化融合模块的学习任务。从概念上讲,3×3卷积层融合了输入特征、全局特征以及其他位置的输入和全局特征,这是一项复杂的任务。融合模块的目标可以简化,因为它可以融合输入和全局特征,而不依赖于特征图中的其他位置。因此,作者在融合中使用1×1卷积层,而不是3×3卷积层。
其次,将3×3卷积层替换为1×1卷积层是消除
MobileViTv1
架构扩展中的主要限制之一。通过改变网络宽度并保持深度恒定,将MobileViT-v1
从XXS
扩展到S
。更改MobileViTv1 Block
的宽度&