CBAM解析: 卷积块注意模块的介绍

目录

引言

相关工作

网络工程

注意力机制

卷积块注意模块

渠道注意力模块

空间注意力模块。

注意模块的布置


摘要:提出了卷积块注意模块 (CBAM),这是一种用于前馈卷积神经网络的简单而有效的注意模块。给定一个中间特征图,我们的模块依次沿两个独立的维度 (通道和空间) 推断注意力图,然后将注意力图乘以输入特征图以进行自适应特征细化。因为CBAM是一个轻量级的通用模块,所以它可以无缝集成到任何CNN架构中,开销可以忽略不计,并且可以与基础CNN一起端到端训练。

引言

卷积神经网络 (cnn) 因为其丰富的表示能力,显著推动了视觉处理 [1,2,3]。为了提高cnn的性能,最近的研究主要研究了网络的三个重要因素: 深度,宽度和基数

从LeNet体系结构 [4] 到残差式网络 [5,6,7,8] ,网络已经变得更加深入。VGGNet [9] 显示,堆叠具有相同形状的块表现出非常好的性能。遵循同样的思想,ResNet [5] 使用skip connection,堆叠相同的残差块,以构建极其深入的体系结构。GoogLeNet [10] 表明宽度是提高模型性能的另一个重要因素。Zagoruyko和Komodakis [6] 建议增加基于ResNet架构的网络宽度。他们已经表明,在CIFAR基准上,具有增加宽度的28层ResNet可以胜过具有1001层的极深ResNetXception [11]和ResNeXt [7] 提出来增加网络的基数。他们从经验上表明,基数不仅节省了参数的总数,而且比其他两个因素 (深度和宽度) 具有更强的表示能力

除了这些因素之外,我们还研究了架构设计的另一个方面,即注意力。注意的意义已经在以前的文献 [12,13,14,15,16,17] 中进行了广泛的研究。我们的目标是通过使用注意机制来提高表示能力: 关注重要特征并抑制不必要的特征。在本文中,我们提出了一种新的网络模块,称为 “卷积块注意模块”。由于卷积操作通过将交叉通道和空间信息混合在一起来提取信息特征,因此我们采用我们的模块来强调沿这两个主要维度 (通道和空间轴) 的有意义的特征。为了实现这一点,我们顺序地应用通道和空间注意模块 (如图1所示),以便每个分支可以分别在通道和空间轴中学习 “什么” 和 “在哪里”。因此,我们的模块通过学习强调或抑制信息有效地帮助网络内的信息流动

 

相关工作

网络工程

“网络工程” 一直是最重要的视觉研究之一因为精心设计的网络可确保在各种应用中显着提高性能。自从大规模的CNN成功实施以来,已经提出了广泛的体系结构 [19]。一种直观而简单的扩展方式是增加神经网络的深度 [9]。Szegedy等人 [10] 引入了使用多分支体系结构的Inception网络,其中每个分支都经过精心定制。简单增加深度由于困难的梯度传播使性能达到饱和,但ResNet [5] 提出了一种简单的跳跃连接来缓解深度网络的优化问题。基于ResNet架构,开发了各种模型,例如WideResNet [6],Inception-ResNet [8] 和ResNeXt [7]。WideResNet [6] 提出了一种残差网络,具有更多数量的卷积滤波器和减小的深度。PyramidNet [20] 是WideResNet的严格概括,其中网络的宽度逐渐增加。ResNeXt [7] 建议使用分组卷积,并表明增加基数可以提高分类精度。最近,Huang等人 [21] 提出了一种新的体系结构,即DenseNet。它将输入特征与输出特征迭代连接,使每个卷积块能够从所有先前的块接收原始信息。虽然大多数最近的网络工程方法主要针对三个因素深度 [19,9,10,5],宽度 [10,22,6,8] 和基数 [7,11],但我们专注于另一个方面,“注意力”,人类视觉系统的好奇方面之一。

注意力机制

Wang等。[27] 提出了使用编码器解码器样式注意模块的残差注意网络。通过完善特征图,网络不仅性能良好,而且对噪声输入也具有鲁棒性。我们不是直接计算3d注意力图,而是分别学习渠道注意力和空间注意力。3D特征图的单独注意力生成过程具有更少的计算和参数开销,因此可以用作已有的基础CNN架构的即插即用模块。

[28] 引入了一个紧凑的模块来利用通道间关系。在他们的挤压和激励模块中,他们使用全局平均池特征来计算信道上的注意力。但是,我们表明这些功能是次优的功能,以推断出良好的渠道注意力,因此我们建议也使用最大池化功能。他们也错过了空间注意力,这在决定 “哪里” 集中在一起起着重要作用。在我们的CBAM中,我们基于有效的体系结构同时利用空间和渠道注意力,并通过经验验证利用两者都优于仅使用渠道注意力 [28]。

同时,BAM [31] 采取了类似的方法,将3D注意力图推断分解为通道和空间。当我们插入每个卷积块时,它们将BAM模块放置在网络的每个瓶颈处

卷积块注意模块

 

渠道注意力模块

我们通过利用特征的通道间关系来生成通道注意图。由于特征图的每个通道都被视为特征检测器 [32],因此通道注意力集中在给定输入图像的 “什么” 有意义。为了有效地计算通道注意力,我们挤压了输入特征图的空间维度为了聚合空间信息,到目前为止,人们普遍采用平均池化。Zhou等人 [444] 建议使用它来有效地学习目标对象的范围,Hu等人 [28] 在他们的注意力模块中采用它来计算空间统计。我们认为max-pooling还收集了有关独特对象特征的另一个重要线索,以推断出更好的渠道关注。因此,我们同时使用平均池化和最大池化。我们从经验上证实,利用这两个特征极大地提高了网络的表示能力,而不是独立使用每个特征 (见第4.1节),显示了我们设计选择的有效性。我们在下面描述详细的操作。

我们首先通过使用平均pooling和max-pooling操作来聚合特征图的空间信息生成两个不同的空间上下文描述符,分别表示平均pooling特征和max-pooling特征。然后将两个描述符转发到共享网络,以生成我们的频道注意力图。共享网络由具有一个隐藏层的多层感知器 (MLP) 组成。为了减少参数开销,隐藏激活大小设置为RC/r × 1,其中r是缩减比。在将共享网络应用于每个描述符之后,我们使用元素求和来合并输出特征向量。简而言之,渠道关注度计算为:

 

 

import torch
import torch.nn as nn

class ChannelAttentionModule(nn.Module):
    def __init__(self, channel, ratio=16):
        super(ChannelAttentionModule, self).__init__()
        self.avg_pool = nn.AdaptiveAvgPool2d(1)
        self.max_pool = nn.AdaptiveMaxPool2d(1)

        self.shared_MLP = nn.Sequential(
            nn.Conv2d(channel, channel // ratio, 1, bias=False),
            nn.ReLU(),
            nn.Conv2d(channel // ratio, channel, 1, bias=False)
        )
        self.sigmoid = nn.Sigmoid()

    def forward(self, x):
        avgout = self.shared_MLP(self.avg_pool(x))
        maxout = self.shared_MLP(self.max_pool(x))
        return self.sigmoid(avgout + maxout)

if __name__=='__main__':
    model=ChannelAttentionModule(64)
    input=torch.randn(1,64,64,64)
    output=model(input)
    print(output.shape)

空间注意力模块。

我们利用特征的空间间关系生成空间注意图。与渠道注意力不同,空间注意力集中在 “哪里” 是信息部分,与渠道注意力互补。为了计算空间注意力,我们首先沿通道轴应用平均池化和最大池化操作,并将它们连接起来以生成有效的特征描述符。沿通道轴应用池化操作被证明可以有效地突出显示信息区域 [34]。在级联特征描述符上,我们应用卷积层以生成空间注意图,该图编码要强调或抑制的位置。我们在下面描述详细的操作 

我们通过使用两个池化操作来聚合特征图的通道信息,生成两个2D图。每个表示通道上的平均池特征和最大池特征。然后将它们通过标准的卷积层连接和卷积,生成我们的2D空间注意力图。简而言之,空间注意力计算为

 

import torch
import torch.nn as nn

class SpatialAttentionModule(nn.Module):
    def __init__(self):
        super(SpatialAttentionModule, self).__init__()
        self.conv2d = nn.Conv2d(in_channels=2, out_channels=1, kernel_size=7, stride=1, padding=3)
        self.sigmoid = nn.Sigmoid()

    def forward(self, x):
        avgout = torch.mean(x, dim=1, keepdim=True)
        maxout, _ = torch.max(x, dim=1, keepdim=True)
        out = torch.cat([avgout, maxout], dim=1)
        out = self.sigmoid(self.conv2d(out))
        return out

if __name__=='__main__':
    model=SpatialAttentionModule()
    input=torch.randn(1,64,64,64)
    output=model(input)
    print(output.shape)

注意模块的布置

给定输入图像,两个注意模块 (通道和空间) 计算互补注意,分别关注 “什么” 和 “哪里”。考虑到这一点,可以以并行或顺序的方式放置两个模块。我们发现顺序排列比平行排列给出更好的结果。对于顺序过程的安排,我们的实验结果表明,通道一阶略好于空间一阶。

import torch
import torch.nn as nn
import torchvision


class ChannelAttentionModule(nn.Module):
    def __init__(self, channel, ratio=16):
        super(ChannelAttentionModule, self).__init__()
        self.avg_pool = nn.AdaptiveAvgPool2d(1)
        self.max_pool = nn.AdaptiveMaxPool2d(1)

        self.shared_MLP = nn.Sequential(
            nn.Conv2d(channel, channel // ratio, 1, bias=False),
            nn.ReLU(),
            nn.Conv2d(channel // ratio, channel, 1, bias=False)
        )
        self.sigmoid = nn.Sigmoid()

    def forward(self, x):
        avgout = self.shared_MLP(self.avg_pool(x))
       
        maxout = self.shared_MLP(self.max_pool(x))
        return self.sigmoid(avgout + maxout)


class SpatialAttentionModule(nn.Module):
    def __init__(self):
        super(SpatialAttentionModule, self).__init__()
        self.conv2d = nn.Conv2d(in_channels=2, out_channels=1, kernel_size=7, stride=1, padding=3)
        self.sigmoid = nn.Sigmoid()

    def forward(self, x):
        avgout = torch.mean(x, dim=1, keepdim=True)
        maxout, _ = torch.max(x, dim=1, keepdim=True)
        out = torch.cat([avgout, maxout], dim=1)
        out = self.sigmoid(self.conv2d(out))
        return out


class CBAM(nn.Module):
    def __init__(self, channel):
        super(CBAM, self).__init__()
        self.channel_attention = ChannelAttentionModule(channel)
        self.spatial_attention = SpatialAttentionModule()

    def forward(self, x):
        out = self.channel_attention(x) * x
        out = self.spatial_attention(out) * out
        return out


class ResBlock_CBAM(nn.Module):
    def __init__(self,in_places, places, stride=1,downsampling=False, expansion = 4):
        super(ResBlock_CBAM,self).__init__()
        self.expansion = expansion
        self.downsampling = downsampling

        self.bottleneck = nn.Sequential(
            nn.Conv2d(in_channels=in_places,out_channels=places,kernel_size=1,stride=1, bias=False),
            nn.BatchNorm2d(places),
            nn.ReLU(inplace=True),
            nn.Conv2d(in_channels=places, out_channels=places, kernel_size=3, stride=stride, padding=1, bias=False),
            nn.BatchNorm2d(places),
            nn.ReLU(inplace=True),
            nn.Conv2d(in_channels=places, out_channels=places*self.expansion, kernel_size=1, stride=1, bias=False),
            nn.BatchNorm2d(places*self.expansion),
        )
        self.cbam = CBAM(channel=places*self.expansion)

        if self.downsampling:
            self.downsample = nn.Sequential(
                nn.Conv2d(in_channels=in_places, out_channels=places*self.expansion, kernel_size=1, stride=stride, bias=False),
                nn.BatchNorm2d(places*self.expansion)
            )
        self.relu = nn.ReLU(inplace=True)

    def forward(self, x):
        residual = x
        out = self.bottleneck(x)
        print(x.shape)
        out = self.cbam(out)
        if self.downsampling:
            residual = self.downsample(x)

        out += residual
        out = self.relu(out)
        return out


model = ResBlock_CBAM(in_places=16, places=4)
print(model)

input = torch.randn(1, 16, 64, 64)
out = model(input)
print(out.shape)

  • 2
    点赞
  • 22
    收藏
    觉得还不错? 一键收藏
  • 打赏
    打赏
  • 1
    评论
1.版本:matlab2014/2019a/2021a,内含运行结果,不会运行可私信 2.领域:智能优化算法、神经网络预测、信号处理、元胞自动机、图像处理、路径规划、无人机等多种领域的Matlab仿真,更多内容可点击博主头像 3.内容:标题所示,对于介绍可点击主页搜索博客 4.适合人群:本科,硕士等教研学习使用 5.博客介绍:热爱科研的Matlab仿真开发者,修心和技术同步精进,matlab项目合作可si信 %% 开发者:Matlab科研助手 %% 更多咨询关注天天Matlab微信公众号 ### 团队长期从事下列领域算法的研究和改进: ### 1 智能优化算法及应用 **1.1 改进智能优化算法方面(单目标和多目标)** **1.2 生产调度方面** 1.2.1 装配线调度研究 1.2.2 车间调度研究 1.2.3 生产线平衡研究 1.2.4 水库梯度调度研究 **1.3 路径规划方面** 1.3.1 旅行商问题研究(TSP、TSPTW) 1.3.2 各类车辆路径规划问题研究(vrp、VRPTW、CVRP) 1.3.3 机器人路径规划问题研究 1.3.4 无人机三维路径规划问题研究 1.3.5 多式联运问题研究 1.3.6 无人机结合车辆路径配送 **1.4 三维装箱求解** **1.5 物流选址研究** 1.5.1 背包问题 1.5.2 物流选址 1.5.4 货位优化 ##### 1.6 电力系统优化研究 1.6.1 微电网优化 1.6.2 配电网系统优化 1.6.3 配电网重构 1.6.4 有序充电 1.6.5 储能双层优化调度 1.6.6 储能优化配置 ### 2 神经网络回归预测、时序预测、分类清单 **2.1 bp预测和分类** **2.2 lssvm预测和分类** **2.3 svm预测和分类** **2.4 cnn预测和分类** ##### 2.5 ELM预测和分类 ##### 2.6 KELM预测和分类 **2.7 ELMAN预测和分类** ##### 2.8 LSTM预测和分类 **2.9 RBF预测和分类** ##### 2.10 DBN预测和分类 ##### 2.11 FNN预测 ##### 2.12 DELM预测和分类 ##### 2.13 BIlstm预测和分类 ##### 2.14 宽度学习预测和分类 ##### 2.15 模糊小波神经网络预测和分类 ##### 2.16 GRU预测和分类 ### 3 图像处理算法 **3.1 图像识别** 3.1.1 车牌、交通标志识别(新能源、国内外、复杂环境下车牌) 3.1.2 发票、身份证、银行卡识别 3.1.3 人脸类别和表情识别 3.1.4 打靶识别 3.1.5 字符识别(字母、数字、手写体、汉字、验证码) 3.1.6 病灶识别 3.1.7 花朵、药材、水果蔬菜识别 3.1.8 指纹、手势、虹膜识别 3.1.9 路面状态和裂缝识别 3.1.10 行为识别 3.1.11 万用表和表盘识别 3.1.12 人民币识别 3.1.13 答题卡识别 **3.2 图像分割** **3.3 图像检测** 3.3.1 显著性检测 3.3.2 缺陷检测 3.3.3 疲劳检测 3.3.4 病害检测 3.3.5 火灾检测 3.3.6 行人检测 3.3.7 水果分级 **3.4 图像隐藏** **3.5 图像去噪** **3.6 图像融合** **3.7 图像配准** **3.8 图像增强** **3.9 图像压缩** ##### 3.10 图像重建 ### 4 信号处理算法 **4.1 信号识别** **4.2 信号检测** **4.3 信号嵌入和提取** **4.4 信号去噪** ##### 4.5 故障诊断 ##### 4.6 脑电信号 ##### 4.7 心电信号 ##### 4.8 肌电信号 ### 5 元胞自动机仿真 **5.1 模拟交通流** **5.2 模拟人群疏散** **5.3 模拟病毒扩散** **5.4 模拟晶体生长** ### 6 无线传感器网络 ##### 6.1 无线传感器定位 ##### 6.2 无线传感器覆盖优化 ##### 6.3 室内定位 ##### 6.4 无线传感器通信及优化 ##### 6.5 无人机通信中继优化 #####
非常感谢您的提问。CBAM(Convolutional Block Attention Module)注意力模块是一种利用注意力机制加强卷积神经网络CNN)效果的方法,在一个CNN卷积之后加入CBAM模块可以提高网络的分类准确率。CBAM主要结构有两层,分别是通道注意力和空间注意力,通过对每个特征通道和通道组的信息进行交互和筛选,进行空间和通道上的自适应特征加权,从而达到更好的特征筛选和决策。 通道注意力模块的基本思想是在每个特征通道上赋予不同的重要性,以便网络能够更加有效地从每个通道提取有用的特征。通道注意力模块的子模块是全局最大池化层,这一层可以在各个通道上进行特征值的最大池化,从而提取出各个通道中的最重要信息。 空间注意力模块则是在每个特征通道组中分别为每个空间位置分配权值,以便网络能够适应不同尺寸的输入。空间注意力模块的子模块卷积核,通过卷积神经网络中标准的卷积操作,网络能够更加精准地捕捉到图像中的像素信息,从而提高了卷积神经网络的性能和效果。 总体来看,CBAM注意力模块CNN中加入自适应特征加权和全局特征池化等注意力机制,可以使得卷积神经网络更加有效地捕捉图像特征,并提高了特征编码的能力,这一创新性的特征提取方法已经被广泛应用于图像分类、目标检测和分割任务中。 以上是对CBAM注意力模块的基本介绍,希望对您有所帮助。如果您还有其他问题,欢迎随时提出,我会尽力回答。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

快撑死的鱼

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值