Listen,Attend,and Spell(LAS)——李宏毅人类语言处理学习笔记

在这里插入图片描述

Listen

Encoder目标:
移除语者之间的差异,去掉noises,提取出与语音辨识的相关信息
输入长度(T)和输出长度一样
在这里插入图片描述
encoder有很多做法:
在这里插入图片描述
在这里插入图片描述
CNN见文章:CNN-卷积神经网络

在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
self-attention见文章self-attention
在这里插入图片描述
在这里插入图片描述
相邻之间差异不是很大,为了节省计算量,让你的训练更有效率,通常会采用down sampling
Pyramid RNN将两个结合,然后送到下一层。Pooling over time则是两个中取一个送到下一层。

在这里插入图片描述

Attention

match这个function可以自己定义,常用的是dot-product attention,作用是计算h1(Key)和z0(Query)的相似度。
在这里插入图片描述
还有一种additive attention
在这里插入图片描述
c0(在文献上常常被成为Context Vector)会被当做decoder即RNN input
在这里插入图片描述
distribution(是通过softmax的)会给每一个token一个概率值
在这里插入图片描述

Spell

假设输入的一段声音讯号是cat,则model先后的需要输出c——a——t
先输出c
在这里插入图片描述
输出c后,用z1再次计算新的阿尔法的值
在这里插入图片描述
注意:a是由上一层的c和z2共同得到
在这里插入图片描述
EOS 代表辨识结束
在这里插入图片描述

Beam Search

red path:每一次都选择概率最大的路径
在这里插入图片描述
Greedy Decoding不见得能找到几率最大的那个
在这里插入图片描述
解决上述问题的方法:Beam Search,每次都保留B个最好的路径。Beam size的大小需要自己去考量的。
在这里插入图片描述

Training

输入是cat,我们希望Cross entropy越小越好,换言之p©越大越好
在这里插入图片描述
在这里插入图片描述

Why Teacher Forcing?

如果前面的输出是错误的
在这里插入图片描述
经过一连串的training后,Model变厉害了,得到了正确的输出
在这里插入图片描述

不管前面输出什么只专注训练c——>a这件事
在这里插入图片描述

Back to Attention

在这里插入图片描述
在这里插入图片描述
在语音识别上我们希望阿尔法是由左向右
在这里插入图片描述
而不是阿尔法乱跳
在这里插入图片描述
所以第一篇用LAS做语音辨识的作者加了一个机制:
Location-aware attention
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述

在这里插入图片描述

Limitation of LAS

在这里插入图片描述

  • 0
    点赞
  • 0
    收藏
    觉得还不错? 一键收藏
  • 打赏
    打赏
  • 0
    评论
过去半年以来,自然语言处理领域进化出了一件神器。此神器乃是深度神经网络的一种新模式,该模式分为:embed、encode、attend、predict四部分。本文将对这四个部分娓娓道来,并且剖析它在两个实例中的用法。 人们在谈论机器学习带来的提升时,往往只想到了机器在效率和准确率方面带给人们的提升,然而最重要的一点却是机器学习算法的通用性。如果你想写一段程序来识别社交媒体平台上的侮辱性帖子,就把问题泛化为“需要输入一段文本,预测出文本的类别ID”。这种分类与识别侮辱性帖子或是标记电子邮件类别之类的具体任务无关。如果两个问题的输入和输出类型都一致,那我们就应复用同一套模型的代码,两者的区别应该在于送入的训练数据不同,就像我们使用同一个游戏引擎玩不同的游戏。 笔者用spaCy和Keras实现了自然语言推理的可分解注意力模型。代码已经上传到github 假设你有一项强大的技术,可以预测实数稠密向量的类别标签。只要输入输出的格式相同,你就能用这项技术解决所有的问题。与此同时,你有另一项技术,可以用一个向量和一个矩阵预测出另一个向量。那么,现在你手里就握着三类问题的解决方案了,而不是两类。为什么是三类呢?因为如果第三类问题是通过矩阵和一个向量,得到一个类别标签,显然你可以组合利用前两种技术来解决。大多数NLP问题可以退化成输入一条或多条文本的机器学习问题。如果我们能将这些文本转化为向量,我们就可以复用现有的深度学习框架。接下来就是具体的做法。

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包

打赏作者

我是小蔡呀~~~

你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20
扫码支付:¥1
获取中
扫码支付

您的余额不足,请更换扫码支付或充值

打赏作者

实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值