Transformer体系详解

想喝冰拿铁

已于 2024-03-18 22:05:47 修改

阅读量1.9k

点赞数 32

分类专栏： ML网络笔记文章标签： transformer 深度学习人工智能 python 算法

于 2024-03-18 22:05:35 首次发布

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/weixin_49825058/article/details/136821415

版权

ML网络笔记专栏收录该内容

3 篇文章 0 订阅

订阅专栏

Transformer是谷歌在2017年提出的著名算法，源自于论文《Attention Is All You Need》。

1.Transformer的主要结构

Transformer是一个基于Encoder-Decoder框架的模型，它的主要结构分为四个部分。分别是输入部分（Embedding）、Encoder、Decoder和输出部分（线性Linear层和Softmax层）。
其中最重要的是第2和第3部分，即Encoder和Decoder。

1.1 输入层

其实就是，经过向量化和加法的操作，实现了单词的拆分与单词的位置信息的融入，输出的张量带有了位置信息。
Transformer的输入主要包括两部分：

源语言句子（左）和位置编码器
目标语言句子（右）和位置编码器

①Embedding：句子单词化
②Positional Encoding：相当于加上一个数（代表位置信息），再变成统一长度。
*Embedding层称作文本嵌入层，产生的张量称为词嵌入张量。
*Positional Encoding是位置编码器。在第二步的encoder里，没有针对词汇位置信息的处理，因此需要在Embedding后面加入位置编码器，使生成的张量带有位置信息。（词汇位置不同，可能会产生不同语义的信）

1.2 编码器Encoder（说明书）

其实就是，经过一系列的矩阵操作，实现了单词间的权重计算，再输出的张量就带有了其他单词的上下文信息。这里输出的矩阵相当于字典Key和Value。

主要组成部分：（n个）

自注意力层：多头自注意力子层+规范化层+残差连接
前馈层：向前传播的全连接子层+规范化层+残差连接

源语言句子经过编码器（Encoder）进行编码，得到一系列的编码表示。

1.3解码器Decoder（拼零件）

其实就是，通过单词间的权重计算，得到带有了位置信息和上下文信息的向量，协同Encoder得到的字典矩阵，经过一系列的矩阵操作，输出预测向量。

主要组成部分：（n个）

自注意力层（相当于预测的Query）：多头自注意力子层+规范化层+残差连接
注意力层（相当于字典的Key和Value）：多头注意力子层+规范化层+残差连接
前馈层：向前传播的全连接子层+规范化层+残差连接

*编码器有两个输入：解码器传来的编码表示和目标语言句子，逐步生成翻译结果。

1.4 输出层

其实就是，接收Decoder输出的向量，先变成一维向量，然后算出最大概率的单词索引，根据索引输出单词。

主要组成部分：

Linear线性层
Softmax层

Self-attention

字典自查表：通过权重标明相互关系
运用像字典的Key 和 Value，像查询的Query，计算输出一个预测结果Z。

d_k是向量维度，是Q,K矩阵的列数。

Muti-attention

多个Self-attention
相当于一件事情找n个人做，保证准确性和稳定性。

不同的注意力权重矩阵QKV，求得n个不同矩阵Z0-Zn，最后取加权平均，输出一个最终的Z 。

残差连接

（典型代表是Resnet）
在这里插入图片描述

想喝冰拿铁

关注

32
点赞
踩
36

收藏

觉得还不错? 一键收藏
0
评论
Transformer体系详解

Transformer是谷歌在2017年提出的著名算法，源自于论文《Attention Is All You Need》。
复制链接

扫一扫

专栏目录

想喝冰拿铁

博客等级

码龄4年

14
原创

159
点赞

146
收藏

130
粉丝

关注

私信

热门文章

分类专栏

最新评论

Diffusion初理解
CSDN-Ada助手: 恭喜您写了第13篇博客《Difusion初理解》，内容详实，观点独特。希望您能继续坚持写作，不断提升自己的表达能力和深度思考能力。下一步建议您可以尝试深入研究Difusion的相关理论，结合实际案例进行分析，为读者提供更多有价值的内容。期待您的下一篇作品！
MLP:多层感知器Multi-layer Perceptron
CSDN-Ada助手: 恭喜你发布了关于MLP的新博客！多层感知器是深度学习领域中非常重要的模型之一，你的分享无疑会对读者有所帮助。接下来，我建议你可以深入探讨MLP模型的一些优缺点，或者结合具体案例分析MLP在实际问题中的应用。希望你能继续保持创作的热情，为大家带来更多有价值的内容！
cs61a-week2笔记
CSDN-Ada助手: 恭喜您写了第8篇博客“cs61a-week2笔记”！持续创作是非常值得鼓励的，您的分享无疑对他人学习和成长起到了积极的推动作用。希望您在未来的创作中可以不断提升内容的深度和广度，可以尝试加入一些个人见解和应用经验，让读者更加深入地了解您的观点和想法。期待您更多精彩的分享，加油！
冰雹猜想——希尔顿序列问题（Hailstone Sequence）
CSDN-Ada助手: 恭喜您写了这么精彩的一篇博客，深入探讨了希尔顿序列问题，让我对这个问题有了更深入的了解。不过我觉得如果能够结合实际案例或者更具体的数学推导来解释希尔顿序列问题，会让读者更容易理解。希望您可以继续坚持创作，期待您的下一篇博客！如何快速涨粉，请看该博主的分享：https://hope-wisdom.blog.csdn.net/article/details/130544967?utm_source=csdn_ai_ada_blog_reply5
二叉搜索树
CSDN-Ada助手: 恭喜你能够持续创作并分享关于二叉搜索树的知识，这篇博客内容很有深度，让我对这个主题有了更深的了解。我希望你能够继续保持这种热情和创作的态度，也建议你可以尝试写一些关于二叉搜索树在实际应用中的案例分析，或者是与其他数据结构的比较，这样能够让读者更好地理解和应用所学的知识。期待你的下一篇作品！ CSDN 正在通过评论红包奖励优秀博客，请看红包流：https://bbs.csdn.net/?type=4&header=0&utm_source=csdn_ai_ada_blog_reply3

最新文章

目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。