NLP学习-Task 4: Contextual Word Embeddings

最新推荐文章于 2022-07-19 17:43:46 发布

iiVax

最新推荐文章于 2022-07-19 17:43:46 发布

阅读量632

点赞数

文章标签：自然语言处理深度学习神经网络机器学习

本文链接：https://blog.csdn.net/weixin_43968103/article/details/107051707

版权

NLP学习

更新流程↓
Task 1: 简介和词向量Word Vectors
Task 2: 词向量和词义Word Senses
Task 3: 子词模型Subword Models
Task 4: Contextual Word Embeddings
Task 5: 大作业
 日本人综艺感从昭和时代开始就这么强了吗？
今日份的舒适
 常见餐桌礼仪

Contextual Word Embeddings

文章目录

1. ELMo

Allen实验室认为好的词表征应该同时兼顾两个问题：一是单词在语义和语法上的复杂特点；二是随着语言环境的改变，这些用法也应该随之变化。
为此，Allen实验室提出了deep contextualized word representation（深度情景化词表征）。这种算法的特点是每个词的表征都是整个输入语句的函数。

具体做法：

现在大语料上以 language model为目标训练处 Bi-LSTM模型，利用它产生词语的表征 （pre-trained biLM模型）。ELMo因此得名embedding from language model。
为了应用在下游NLP任务中，一般先利用下游任务的语料库（此时，忽略掉label）进行 language model的微调（fine tuning），这种微调相当于一种domain transfer。
然后才是利用label的信息进行supervised learning。

ELMo表征是“深”的，就是说它们是biLM的所有层的内部表征的函数。这样做的好处是能够产生丰富的词语表征。高层的LSTM的状态可以捕捉词语意义中和语境相关的那方面的特征(比如可以用来做语义的消歧)，而低层的LSTM可以找到语法方面的特征(比如可以做词性标注)。如果把它们结合在一起，在下游的NLP任务中会体现优势。

在这里插入图片描述

1.1. Bidirectional language models

ELMo顾名思义是从Language Models得来的embeddings，确切的说是来自于Bidirectional language models。具体可以表示为：
$p(t_1,t_2,...,t_N)=\prod_{k=1}^{N}p(t_k|t_1,t_2,...,t_{k-1})和p(t_1,t_2,...,t_N)=\prod_{k=1}^{N}p(t_k|t_{k+1},t_{k+2},...,t_N)$

这里 $t_1,t_2,...,t_N)$ 的是一系列的tokens，作为语言模型可能有不同的表达方法，最经典的方法是利用多层的LSTM，ELMo的语言模型也采取了这种方式。所以这个Bidirectional LM由stacked bidirectional LSTM来表示。

假设输入是 $t o k e n$ 的表示 $x_k^{LM}$ 。在每一个位置 $k$ ，每一层LSTM上都输出相应的context-dependent的表征 $\vec{h}_{k,j}^{LM}$ ，

最低0.47元/天解锁文章

iiVax

关注

0
点赞
踩
1

收藏

觉得还不错? 一键收藏
0
评论
NLP学习-Task 4: Contextual Word Embeddings

NLP学习更新流程↓Task 1: 简介和词向量Word VectorsTask 2: 词向量和词义Word SensesTask 3: 子词模型Subword ModelsTask 4: Contextual Word EmbeddingsTask 5: 大作业日本人综艺感从昭和时代开始就这么强了吗？今日份的舒适常见餐桌礼仪Contextual Word Embeddings文章目录1. ELMo 1.1. Bidirectional language models 1.2..
复制链接

扫一扫