transformer面试总结模型中BN batchNormalize LN layerNormalizer区别

最新推荐文章于 2024-07-24 09:27:34 发布

火星种萝卜

最新推荐文章于 2024-07-24 09:27:34 发布

阅读量735

点赞数

分类专栏： NLP AI理论

原文链接：https://blog.csdn.net/weixin_45069761/article/details/107851875

版权

NLP 同时被 2 个专栏收录

247 篇文章 4 订阅

订阅专栏

206 篇文章 5 订阅

订阅专栏

Transformer中的attention区别？

(1) Encoder的Self-Attention中，Q、K、V相等，他们是上一层Encoder的输出，对于第一层Encoder，他们就是Word Embedding和Positional Embedding相加得到的输入
(2) Decoder的Self-Attention 中，Q、K、V相等，它们是上一层 Decoder 的输出，对于第一层Decoder，他们就是Word Embedding和Positional Embedding相加得到的输入
(3) 在Encoder-Decoder Attention中，Q来自于上一层Decoder的输出，K和V来自于 Encoder的输出

https://blog.csdn.net/weixin_45069761/article/details/107851875

火星种萝卜

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

火星种萝卜 CSDN认证博客专家 CSDN认证企业博客

码龄17年

303: 原创

2万+: 周排名

96万+: 总排名

436万+: 访问

: 等级

3万+: 积分

429: 粉丝

754: 获赞

323: 评论

2033: 收藏

私信

关注

热门文章

分类专栏

最新评论

jupyter|魔法函数问题| UsageError: Line magic function `%` not found
Song9177: 还真是一下就解决了，感谢
tensorflow1.0代码迁移到2.0官方指导
ivy__w: 请问下把代码改为您文中写的之后报错 tensorflow 中的 disable_resource_variables 函数（位于 D:\Users\anaconda\envs\randlanet\lib\site-packages\tensorflow\python\compat\v2_compat.py 文件的第 96 行）已被弃用，将来会被移除，并给出了更新的指导说明，即长期来看不支持非资源变量。是为什么呀？要怎么解决才行？
假设训练数据集中有10万个词，四元语法需要存储多少词频和多词相邻频率？《动手学深度学习李沐》转
Laughing Man.: 个人见解是：计算机在最开始计算多词相邻概率（包括 n=2 ,n = 3 ,n = 4）的过程是相互独立的，就是计算机分别及计算以上三者并存储，这样考虑根据排列组合的理解就变成了 10万*10万， 10万*10万*10万，10万* 10万*10万*10万(因为可能存在相同的词语相邻) ，所以最后的大小就是 10**2 + 10**3 +10**4 你的理解是在语料库已经建立完毕的情况下，对一条特定的语句需要用到的相邻概率的数量（只有在这种情况下，才会考虑词语已经使用过的情况）
如何理解：先减1后取反和先取反后加1得到的结果是一样的，故仍可采用取反加1的方法，即对于机器数为负数，则有［X］原=［［X］补］补。
做而论道_CS: 求负数 (X < 0) 的 n 位补码，公式是：　[ X ]补＝ 2^n － | X | －－－－－－－－－－－－－－－－－－－－－按照公式来求补码，是非常简单的事。　根本也不涉及什么：符号位原码反码取反加一。例：－31 的八位补码是多少？解： 2^8 － |－31 | 　= 256 － 31 = 225 = 1110 0001 (二进制) 这不就求出来了嘛！但是，有人偏要找麻烦，鼓吹什么 “取反加一” ！那就慢慢算吧。－－－－－－－－－－－－－－－－－－－－－先看，2^n 的二进制，是多少呢？　是：111 ... 1 + 1。（共有 n 个 1，后面再加上一个 1。）再看，| X | 的二进制，又是多少呢？取绝对值后，就是 n 位的正数。可写成：| X | = 0xx ... x。　（共有 n－1 个 x 。）其中的 x，是一位二进制数，即 0 或 1。－－－－－－－－－－－－－－－－－－－－－所以，公式 2^n － | X | 的二进制形式，就是：　　111 ... 1 ＋ 1 － 0xx ... x 。此公式，还可以改写为以下两种形式：　（111 ... 1 － 0xx ... x）＋ 1　　　（1）　　111 ... 1 －（0xx ... x － 1）　　（2）由小学所学的知识，可知：　方程(1) 和方程(2)，是等效的。－－－－－－－－－－－－－－－－－－－－－另外：1 － 0 ＝ 1、1 － 1 ＝ 0。因此：1 － x，　就是对 x 取反。－－－－－－－－－－－－－－－－－－－－－那么，方程 (1)，就是：先取反、后加一；　而，方程 (2)，就是：先减一、后取反。至此，就证明了：　取反加一、减一取反，功能是相同的。证明这个命题，只需用到小学的知识。　根本就不用：原码反码这些乱七八糟的事！
如何理解：先减1后取反和先取反后加1得到的结果是一样的，故仍可采用取反加1的方法，即对于机器数为负数，则有［X］原=［［X］补］补。
做而论道_CS: 先减1后取反、先取反后加1，确实是一样的。但是，证明方法、过程，却不是你写的这些。

最新文章

目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。