Transformer详解

mmfloatingdream

已于 2024-08-19 19:09:57 修改

阅读量856

点赞数 10

文章标签： transformer 深度学习人工智能

于 2024-08-19 16:31:13 首次发布

本文链接：https://blog.csdn.net/m0_59592518/article/details/141321208

版权

Transformer的结构图主要分为4个部分，其中最重要的就是2和3Encoder-Decoder部分，Transformer是一个基于Encoder-Decoder框架的模型。

Encoder block由6个encoder堆叠而成，Nx=6。上图2中的灰框部分就是一个encoder的内部结构，一个encoder由Multi-Head Attention 和全连接神经网络Feed Forward Network构成。

Transformer的inputs 输入

Transformer输入是一个序列数据，还是以上篇中提到的"Tom chase Jerry" 翻译成中文"汤姆追逐杰瑞"为例：
Encoder 的 inputs就是"Tom chase Jerry" 分词后的词向量。可以是任意形式的词向量，如word2vec，GloVe，one-hot编码。

假设上图中每一个词向量都是一个512维的词向量。

输入inputs embedding后需要给每个word的词向量添加位置编码positional encoding，为什么需要添加位置编码呢？
首先咱们知道，一句话中同一个词，如果词语出现位置不同，意思可能发生翻天覆地的变化，就比如：我欠他100W 和他欠我100W。这两句话的意思一个地狱一个天堂。可见获取词语出现在句子中的位置信息是一件很重要的事情。但是Transformer 是完全基于self-Attention地，而self-attention是不能获取词语位置信息地，就算打乱一句话中词语的位置，每个词还是能与其他词之间计算attention值，就相当于是一个功能强大的词袋模型，对结果没有任何影响。（一会儿在介绍Encoder的时候再详细说明）所以在我们输入的时候需要给每一个词向量添加位置编码。

这个positional encoding怎么获取呢？
1.可以通过数据训练学习得到positional encoding，类似于训练学习词向量，goole在之后的bert中的positional encoding便是由训练得到地。
2.《Attention Is All You Need》论文中Transformer使用的是正余弦位置编码。位置编码通过使用不同频率的正弦、余弦函数生成，然后和对应的位置的词向量相加，位置向量维度必须和词向量的维度一致。过程如上图，PE（positional encoding）计算公式如下：

释一下上面的公式：
pos表示单词在句子中的绝对位置，pos=0，1，2…，例如：Jerry在"Tom chase Jerry"中的pos=2；dmodel表示词向量的维度，在这里dmodel=512；2i和2i+1表示奇偶性，i表示词向量中的第几维，例如这里dmodel=512，故i=0，1，2…255。
至于上面这个公式是怎么得来地，其实不重要，因为很有可能是作者根据经验自己造地，而且公式也不是唯一地，后续goole在bert中的positional encoding也没有再使用这种方法而是通过训练PE，说明这种求位置向量的方法还是存在一定问题地。
这里不做详细的介绍了，想要深究的可以参考一下知乎上的这些回答：如何理解Transformer论文中的positional encoding，和三角函数有什么关系？

为什么是将positional encoding与词向量相加，而不是拼接呢？
拼接相加都可以，只是本身词向量的维度512维就已经蛮大了，再拼接一个512维的位置向量，变成1024维，这样训练起来会相对慢一些，影响效率。两者的效果是差不多地，既然效果差不多当然是选择学习习难度较小的相加了。

最低0.47元/天解锁文章

mmfloatingdream

关注

10
点赞
踩
10

收藏

觉得还不错? 一键收藏
0
评论
Transformer详解

Transformer的结构图主要分为4个部分，其中最重要的就是2和3Encoder-Decoder部分，Transformer是一个基于Encoder-Decoder框架的模型。Encoder block由6个encoder堆叠而成，Nx=6。上图2中的灰框部分就是一个encoder的内部结构，一个encoder由Multi-Head Attention 和全连接神经网络Feed Forward Network构成。
复制链接

扫一扫