ELMO论文笔记Deep contextualized word representations

1. 为什么引入

elmo是在传统词向量中加入了对上下文信息的关注,使得同一个词在不同上下文中有不同含义,得到不同的表达。

2. 整体架构

elmo主要使用了一个字符卷积层(get raw word vectors) 加上 两层双向的LSTM语言模型,来充分获得一个词的所有上下文信息,这正是与word2vec等传统词嵌入不同之处。
(各个层之间添加了residual connection传递;elmo中可以添加适量的dropout和l2正则)
在这里插入图片描述
在这里插入图片描述

3. 为什么是两层LSTM

第一层LSTM更容易获得一些浅层的句法信息,如词性标注等
第二层LSTM则更容易获得一些更深层的语言信息,如上下文、词义等
elmo则是这两(多)层任务的权重组合,公式如下:
在这里插入图片描述
其中s-task是各个层的softmax权值,标量参数γ-task允许任务模型缩放整个ELMo向量(根据下游任务,通过调整这两个参数来调整词向量适配不同的上下文,及不同的任务),
h则是各个任务层(一个字符卷积层+两个bilstm层 共三个任务层):
在这里插入图片描述

5. 如何应用

在有监督的任务中可以:

  1. 连接elmo和原任务初始输入(上下文无关)词向量xk
    在这里插入图片描述

  2. 连接elmo和原任务RNN输出(上下文相关)词向量hk
    在这里插入图片描述

  • 0
    点赞
  • 2
    收藏
    觉得还不错? 一键收藏
  • 1
    评论
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值