图解 Attention(完整版)!

本文详细介绍了序列到序列(seq2seq)模型,特别是注意力(Attention)机制的工作原理,通过可视化帮助理解其如何处理长文本,提高机器翻译质量。文中还提到了Bahdanau等人和Luong等人的论文,这些论文提出了注意力技术,解决了seq2seq模型的瓶颈问题。文章适合有一定深度学习基础的读者,包含编码器和解码器的运作过程,以及注意力模型的额外处理步骤。
摘要由CSDN通过智能技术生成

↑↑↑关注后"星标"Datawhale

每日干货 & 每月组队学习,不错过

 Datawhale干货 

译者:张贤,哈尔滨工程大学,Datawhale原创作者

本文约4000字,建议阅读11分钟
审稿人:Jepson,Datawhale成员,毕业于中国科学院,目前在腾讯从事推荐算法工作。

序列到序列(seq2seq)模型是一种深度学习模型,在很多任务上都取得了成功,如:机器翻译、文本摘要、图像描述生成。谷歌翻译在 2016 年年末开始使用这种模型。有2篇开创性的论文:

Sutskever等2014年发布的:https://papers.nips.cc/paper/5346-sequence-to-sequence-learning-with-neural-networks.pdf

Cho等2014年发布的:http://emnlp2014.org/papers/pdf/EMNLP2014179.pdf

都对这些模型进行了解释。

然而,我发现,想要充分理解模型并实现它,需要拆解一系列概念,而这些概念是层层递进的。我认为,如果能够把这些概念进行可视化,会更加容易理解。这就是这篇文章的目标。你需要先了解一些深度学习的知识,才能读完这篇文章。我希望这篇文章,可以对你阅读上面提到的 2 篇论文有帮助。

一个序列到序列(seq2seq)模型,接收的输入是一个输入的(单词、字母、图像特征)序列,输出是另外一个序列。一个训练好的模型如下图所示:


在神经机器翻译中,一个序列是指一连串的单词。类似地,输出也是一连串单词。

  • 0
    点赞
  • 2
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值