Transfomer编码器中自注意力机制、前馈网络层、叠加和归一组件等讲解（图文解释）

最新推荐文章于 2024-08-21 17:50:19 发布

沧海之巅

最新推荐文章于 2024-08-21 17:50:19 发布

阅读量537

点赞数

分类专栏：数据治理大语言模型管理体系文章标签：深度学习人工智能机器学习

沧海之巅

本文链接：https://blog.csdn.net/linjie_830914/article/details/131236312

版权

管理体系同时被 3 个专栏收录

72 篇文章 40 订阅 ¥9.90 ¥99.00

订阅专栏

超级会员免费看

大语言模型

40 篇文章 0 订阅

订阅专栏

4 篇文章 0 订阅

订阅专栏

Transformer的编码器由多个相同结构的编码器层堆叠而成，每个编码器包含自注意力机制和前馈网络两部分。自注意力机制通过计算查询矩阵、键矩阵和值矩阵，确定词与词之间的关系，多头注意力则通过多个注意力矩阵提高准确性。位置编码用于保留词序信息，前馈网络由两个ReLU激活的全连接层组成，整个编码器通过残差连接和层归一化加速训练。

摘要由CSDN通过智能技术生成

Transformer中的编码器不止一个，而是由一组N个编码器串联而成，一个编码的输出作为下一个编码器的输入，如下图所示，每一个编码器都从下方接收数据，再输出给上方，以此类推，原句中的特征会由最后一个编码器输出，编码器模块的主要功能就是提取原句中的特征

我们又可以将编码器中的结构进行细分

由上图可知，每一个编码器的构造都是相同的，并且包含两个部分

1：多头注意力层

2：前馈网络层

下面我们对其进行讲解

一、自注意力机制
让我们通过一个例子来快速理解自注意力机制

a dog ate the food because it was hungry

想必大家都能看懂这句英文的意思，句中的it可以指代dog也可以指代food，我们自然是很好理解，但是对于计算机而言该如何决定呢？自注意力机制有助于解决这个问题

以上句为例，我们的模型首先需要计算出单词A的特征值，其次计算dog的特征值，以此类推，当计算每个词的特征值时，模型都需要遍历每个词与句子中其他词的关系，模型可以通过词与词之间的关系来更好的理解当前词的意思

比如当计算it的特征值时，模型会将it与句子中的其他词一一关联，以便更好的理解它的意思

如下图所示&

了解本专栏

超级会员免费看

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
打赏
0
评论
Transfomer编码器中自注意力机制、前馈网络层、叠加和归一组件等讲解（图文解释）

Transformer中的编码器不止一个，而是由一组N个编码器串联而成，一个编码的输出作为下一个编码器的输入，如下图所示，每一个编码器都从下方接收数据，再输出给上方，以此类推，原句中的特征会由最后一个编码器输出，编码器模块的主要功能就是提取原句中的特征。以上句为例，我们的模型首先需要计算出单词A的特征值，其次计算dog的特征值，以此类推，当计算每个词的特征值时，模型都需要遍历每个词与句子中其他词的关系，模型可以通过词与词之间的关系来更好的理解当前词的意思。自注意力机制有助于解决这个问题。
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

打赏作者

沧海之巅 你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20

扫码支付：¥1

获取中

扫码支付

您的余额不足，请更换扫码支付或充值

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。