Contextual Transformer Networks for Visual Recognition论文以及代码解析


论文地址: CoTNet
源码地址: CoTNet

1. Abstract

今天来介绍一篇京东AI研究院的一篇基于Transformer的backbone的论文。

论文提出现有的Transformer设计是在二维特征图上使用Attention,来获得在每个空间位置上的孤立的query和key的注意力矩阵,但是相邻之间的key的上下文信息并没有被充分考虑到。本文提出一种新的Transformer机制说的很玄乎,其实就是一种新的self-Attention机制,即论文中提出的CoT block。该block充分利用了输入key之间的上下文关系,来指导动态注意力矩阵的学习,从而增加了视觉表示的能力,用于各种视觉任务上。
CoT block的实现:首先对输入的feature map使用3x3conv进行上下文编码,得到输出feature的静态上下文表示;其次将这个static key与输入feature map进行concat操作,进行两个连续的1x1conv来得到动态的multi-head attention matrix,然后将这个动态注意力矩阵与输入value矩阵进行相乘得到动态的上下文表示;最后将动态特征表示与第一步得到的静态特征表示进行特征融合得到该block的输出。
其实这篇论文的工作与之前的一篇论文Bottleneck Transformers for Visual Recognition非常相似,因为都是用来替换

  • 1
    点赞
  • 1
    收藏
    觉得还不错? 一键收藏
  • 打赏
    打赏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

从现在开始壹并超

你的鼓励,我们就是hxd

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值