对Attention is all you need 的理解

最新推荐文章于 2024-08-01 11:18:28 发布

mijiaoxiaosan

最新推荐文章于 2024-08-01 11:18:28 发布

阅读量6w

点赞数 31

分类专栏：自然语言处理深度学习文章标签： attention 机器翻译深度学习自然语言处理机器学习

本文链接：https://blog.csdn.net/mijiaoxiaosan/article/details/73251443

版权

本文详细解读谷歌的Transformer模型，该模型抛弃RNN和CNN，仅基于Attention解决序列任务，如机器翻译。Transformer由多个自注意力层和前馈网络构成，能并行计算，提高训练效率。多头注意力机制是其核心，模型通过位置编码引入序列信息。作者探讨了self-attention的优势，包括计算复杂性、并行性和长距离依赖处理。Transformer的提出挑战了传统模型，开启了深度学习的新思路。

摘要由CSDN通过智能技术生成

本文参考的原始论文地址：https://arxiv.org/abs/1706.03762

谷歌昨天在arxiv发了一篇论文名字教Attention Is All You Need，提出了一个只基于attention的结构来处理序列模型相关的问题，比如机器翻译。传统的神经机器翻译大都是利用RNN或者CNN来作为encoder-decoder的模型基础，而谷歌最新的只基于Attention的Transformer模型摒弃了固有的定式，并没有用任何CNN或者RNN的结构。该模型可以高度并行地工作，所以在提升翻译性能的同时训练速度也特别快。

以下是谷歌Transformer的结构示意图。
Transformer结构

模型分为编码器和解码器两个部分，编码器由6个相同的层堆叠在一起，每一层又有两个支层。第一个支层是一个多头的自注意机制，第二个支层是一个简单的全连接前馈网络。在两个支层外面都添加了一个residual的连接，然后进行了layer nomalization的操作。模型所有的支层以及embedding层的输出维度都是 $d_{model} = 512$ . 模型的解码器也是堆叠了六个相同的层。不过每层除了编码器中那两个支层，解码器还加入了第三个支层，如图中所示同样也用了residual以及layer normalization。具体的细节后面再讲。

论文是从attention结构开始介绍Transformer的，这里为了方便，从模型的输入开始介绍。

模型输入。
编码器和解码器的输入就是利用学习好的embeddings将tokens（一般应该是词或者字符）转化为 $d_{model}$ 维向量。对解码器来说，利用线性变换以及softmax函数将解码的输出转化为一个预测下一个token的概率。

位置编码。
由于模型没有任何循环或者卷积，为了使用序列的顺序信息，需要将tokens的相对以及绝对位置信息注入到模型中去。论文在输入embeddings的基础上加了一个“位置编码”。位置编码和embeddings由同样的维度都是 $d_{model}$ 所以两者可以直接相加。有很多位置编码的选择，既有学习到的也有固定不变的。本文中用了正弦和余弦函数进行编码。