Self-Attention 加速方法一览：ISSA、CCNet、CGNL、Linformer

最新推荐文章于 2024-05-25 09:46:53 发布

深兰深延AI

最新推荐文章于 2024-05-25 09:46:53 发布

阅读量945

点赞数 1

分类专栏： CV 文章标签：深度学习 transformer 计算机视觉

本文链接：https://blog.csdn.net/shenlanshenyanai/article/details/123093187

版权

本文探讨了在计算机视觉中优化Self-Attention模块的方法，包括Interlaced Sparse Self-Attention (ISSA)、Criss-cross attention (CCNet)和Linformer。这些方法旨在减少计算量和显存占用，例如通过交错注意力、十字注意力和线性复杂度的自注意力。实验表明，这些优化技术能在保持性能的同时显著提高效率。

摘要由CSDN通过智能技术生成

Attention 机制最早在NLP 领域中被提出，基于attention 的transformer结构近年在NLP的各项任务上大放异彩。在视觉任务中，attention也收到了很多的关注，比较有名的方法包括Non-Local Network，能够在时空volume中对全局的关系进行建模，获得了很好的效果。但视觉任务中的self-attention模块通常需要进行大矩阵的矩阵乘法，显存占用大且比较耗时。所以近年有许多优化self-attention模块速度的方法，这篇笔记主要讨论几篇相关方法，有错误之处欢迎指正。

Self-Attention 简介

Attention 机制通常可以表达为如下的形式

其中，

为query，为key，为value。从检索任务的角度来看，query是要检索的内容，key是索引，value则是待检索的值。attention的过程就是计算query 和key之间的相关性，获得attention map，再基于attention map去获得value中的特征值。而在如下图所示的self-attention中，Q K V均为同一个feature map。

上图是一个self-attention模块的基本结构，输入为

, 分别通过1x1卷积获得。则可以获得attention map为。最后与做矩阵乘法获得与输入shape想同的self-attention feature map。

在self-attention中，计算量和显存占用比较大的主要是生成attention map时的

最低0.47元/天解锁文章

深兰深延AI

关注

1
点赞
踩
3

收藏

觉得还不错? 一键收藏
0
评论
Self-Attention 加速方法一览：ISSA、CCNet、CGNL、Linformer

Attention 机制最早在NLP 领域中被提出，基于attention 的transformer结构近年在NLP的各项任务上大放异彩。在视觉任务中，attention也收到了很多的关注，比较有名的方法包括Non-Local Network，能够在时空volume中对全局的关系进行建模，获得了很好的效果。但视觉任务中的self-attention模块通常需要进行大矩阵的矩阵乘法，显存占用大且比较耗时。所以近年有许多优化self-attention模块速度的方法，这篇笔记主要讨论几篇相关方法，有错误之处欢迎
复制链接

扫一扫

专栏目录