【NLP】Transformer架构解析(一)

本文深入解析Transformer架构,重点介绍其在NLP任务中的应用,如机器翻译和预训练语言模型。Transformer分为输入、输出、编码器和解码器四个部分,输入部分包括文本嵌入层和位置编码器,旨在将词汇转化为向量表示,并补充位置信息。通过实例和代码分析,解释了文本嵌入层和位置编码器的作用。
摘要由CSDN通过智能技术生成

1. 认识Transformer架构

1.1 Transformer模型的作用

  • 基于seq2seq架构的transformer模型可以完成NLP领域研究的典型任务, 如机器翻译, 文本生成等. 同时又可以构建预训练语言模型,用于不同任务的迁移学习.

声明:

在接下来的架构分析中, 我们将假设使用Transformer模型架构处理从一种语言文本到另一种语言文本的翻译工作, 因此很多命名方式遵循NLP中的规则. 比如: Embeddding层将称作文本嵌入层, Embedding层产生的张量称为词嵌入张量, 它的最后一维将称作词向量等.

1.2 Transformer总体架构图

在这里插入图片描述

Transformer总体架构可分为四个部分:

  • 输入部分
  • 输出部分
  • 编码器部分
  • 解码器部分

输入部分包含

评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

chaser&upper

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值