Transfomer编码器中自注意力机制、前馈网络层、叠加和归一组件等讲解（图文解释）

最新推荐文章于 2024-10-31 19:02:23 发布

沧海之巅

最新推荐文章于 2024-10-31 19:02:23 发布

阅读量351

点赞数

分类专栏：管理体系大语言模型 GPT 文章标签：深度学习机器学习语言模型

沧海之巅

本文链接：https://blog.csdn.net/linjie_830914/article/details/131543813

版权

管理体系同时被 3 个专栏收录

72 篇文章 43 订阅 ¥9.90 ¥99.00

订阅专栏

超级会员免费看

大语言模型

40 篇文章 1 订阅

订阅专栏

31 篇文章 2 订阅

订阅专栏

本文详细介绍了Transformer编码器的结构，包括自注意力机制，多头注意力层，位置编码，前馈网络层以及叠加和归一组件。自注意力机制通过计算词与词之间的关系来理解句子意义，多头注意力增强了模型的准确性，位置编码则保留了词序信息。前馈网络层由全连接层组成，叠加和归一组件则用于稳定模型训练和输出。

摘要由CSDN通过智能技术生成

Transformer中的编码器不止一个，而是由一组N个编码器串联而成，一个编码的输出作为下一个编码器的输入，如下图所示，每一个编码器都从下方接收数据，再输出给上方，以此类推，原句中的特征会由最后一个编码器输出，编码器模块的主要功能就是提取原句中的特征

我们又可以将编码器中的结构进行细分

由上图可知，每一个编码器的构造都是相同的，并且包含两个部分

1：多头注意力层

2：前馈网络层

下面我们对其进行讲解

一、自注意力机制
让我们通过一个例子来快速理解自注意力机制

a dog ate the food because it was hungry

想必大家都能看懂这句英文的意思，句中的it可以指代dog也可以指代food，我们自然是很好理解，但是对于计算机而言该如何决定呢？自注意力机制有助于解决这个问题

以上句为例，我们的模型首先需要计算出

了解本专栏

超级会员免费看

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
打赏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

打赏作者

沧海之巅 你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20

扫码支付：¥1

获取中

扫码支付

您的余额不足，请更换扫码支付或充值

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。