transformer构建

二,采用attention和self-attention搭建深度神经网络

  1. multi-head self-attention

此时输出1个序列c1,c2,…cm.此时为single-head

L个单头注意力网络组成,每个单头注意力网络由三个参数。

每个单头自注意 不会共享参数。共3l个参数。

  1. multi-head attention

  1. 搭建深度神经网络的encoder

采用multi-head self-attention + fc 搭建encoder。

注意:此处fc会共享参数。

512*m:

M为输入序列的长度;512为输入x的维度。

由于block的输入和输出的维度相同,可以采用skip connection

每个block有两层。每个block之间不会共享参数。输入和输出的维度是一样的。

  1. 搭建深度神经网络的decoder网络

注意此处:x’,c,u,z均为512维向量。

  1. 最终的transformer模型

  1. Transformer与rnn的对比

因此,tranformer与rnn相似,因此以前怎么用rnn,现在就怎么用transformer模型。

  1. 总结

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值