一篇非常好的transformer年度总结

最新推荐文章于 2022-11-20 23:54:34 发布

视学算法

最新推荐文章于 2022-11-20 23:54:34 发布

阅读量148

点赞数

文章标签：深度学习 java 人工智能 python 机器学习

原文链接：https://mp.weixin.qq.com/s?__biz=MzU4NjIxODMyOQ==&mid=2247507937&idx=4&sn=25d697e7b98d1779f5f5f2b4f049ee94&chksm=fdfc31d7ca8bb8c1273a8bef9226376a9fa608c8885a1fde88d1fbcef42def796879b78f8148&scene=126&&sessionid=0

版权

作者：Xavier Amatriain

翻译: 炼丹小生（炼丹笔记）

很多人的“记忆”并没那么好,特别是对名字.这些年各种各样的transformer涌现出来,各有各的优势,但是他们的名字却不能直白的看出该版本的transformer到底做了什么.这篇的目的就是把所有流行的transformer进行清晰简单的分类,以便大家对transformer家族快速梳理

简介

Transformer是什么就不用多说了,2017年开始至今引用量将近4w的论文<Attention is All you Need>提出了一个encoder-decoder的模型取代了历年一直用的LSTM或者其他RNN,正如标题所述该论文最重要的就是Attention结构了.Transformer最基础的结构如下所示:

顺便温习一下最"核心"的multi-headed attention结构,该结构"匹配"query和key-value对,并且输出value的权重和,value的权重来自于query和key的attention值.Transformer结构使用了多头机制,并行计算特定的attention值,计算方式采用的是Scaled Dot-Product Attentio,如下图所示:

总结transformer主要由以下几个部分组成:

预训练架构: Encoder-Decoder

预训练任务:

Language Modeling(LM) 预测下个token
Masked Language Modeling(MLM) 完形填空
Permuted Language Modeling(PLM) 对句子做排列
Denoising Autoencoder(DAE): 句子中做随机采样,或者随机删除一些token,又或是打乱句子顺序,目标是恢复之前的输入
Contrastive Learning(CTL): 各种对比学习方法

应用:问答、情感分析、实体识别等.

Catalog table

看不清打开该路径:

https://docs.google.com/spreadsheets/d/1ltyrAB6BL29cOv2fSpNQnnq2vbX8UrHl47d7FkIf6t4/edit#gid=0

Transfromer族谱及时间线

参考文献

1.https://xamat.medium.com/transformers-models-an-introduction-and-catalogue-2022-edition-2d1e9039f376

点个在看 paper不断！

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
一篇非常好的transformer年度总结

作者：Xavier Amatriain翻译: 炼丹小生（炼丹笔记）很多人的“记忆”并没那么好,特别是对名字.这些年各种各样的transformer涌现出来,各有各的优势,但是他们的名字却不能直白的看出该版本的transformer到底做了什么.这篇的目的就是把所有流行的transformer进行清晰简单的分类,以便大家对transformer家族快速梳理简介Transfo...
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。