Attention Is All You Need

最新推荐文章于 2024-01-23 16:15:35 发布

计算机CV民工

最新推荐文章于 2024-01-23 16:15:35 发布

阅读量90

点赞数

分类专栏：论文精读文章标签：论文阅读

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/qq_41701723/article/details/132332661

版权

论文精读专栏收录该内容

8 篇文章 0 订阅

订阅专栏

Attention Is All You Need

摘要
self-attention
- Attention(Q,K,V)
Multi head self-attention

在这里插入图片描述

摘要

主导序列转导模型基于复杂的递归或卷积神经网络，该神经网络包括编码器和解码器。性能最好的模型还通过注意力机制将编码器和解码器连接起来。我们提出了一种新的简单的网络体系结构Transformer，它完全基于注意力机制，完全不需要重复和卷积。在两个机器翻译任务上的实验表明，这些模型在质量上更优越，同时具有更高的并行化能力，所需的训练时间显著减少。我们的模型在WMT 2014英译德翻译任务中获得了28.4%的BLEU成绩，比现有的最好成绩(包括语料库)提高了2%以上。在WMT 2014英法翻译任务上，我们的模型在8个GPU上进行了3.5天的培训后，建立了一个新的单一模型最先进的BLEU得分41.8%，这只是文献中最好的模型培训成本的一小部分。我们通过将其成功地应用于具有大量和有限训练数据的英语选区分析，表明该转换器对其他任务具有很好的通用性。

self-attention

在这里插入图片描述

在这里插入图片描述

Attention(Q,K,V)

其中公式的计算详细过程如下：
在这里插入图片描述

q , k , v的求值

在这里插入图片描述

Q , K , V的求值

并行化

在这里插入图片描述

q与k match的过程

在这里插入图片描述

Q与K match的过程

并行化

在这里插入图片描述

与V相乘

并行化

在这里插入图片描述

模块化处理

在这里插入图片描述

Multi head self-attention

在这里插入图片描述
在self-attention的基础上做了均分处理

拆分处理

在这里插入图片描述

head1,head2,等组成

在这里插入图片描述
公式

求单个b的过程

在不同的head中，执行self attention的操作流程
在这里插入图片描述

拼接b，并融合

将不同的head执行concat操作：
在这里插入图片描述

融合

在这里插入图片描述

模块化处理

在这里插入图片描述

计算机CV民工

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
Attention Is All You Need

self attention
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。