词嵌入

最新推荐文章于 2024-05-14 10:21:13 发布

shenzhiping12

最新推荐文章于 2024-05-14 10:21:13 发布

阅读量312

点赞数

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/shenzhiping12/article/details/93795115

版权

词嵌入-----让算法自动的理解一些类似的词（给一些名词起他上一层的名字，看他们到上一层名字的距离）
one-hot的缺点:任何两个one-hot的向量内机为0，无法知道他们的联系和差别，故用特征化的表示来表示每个词，学习这些词的特征和数值
词嵌入可视化------把高维的词嵌入数据嵌入到一个二维空间里，这样就可以可视化了。常用的可视化算法是t-SNEs算法

使用词嵌入做迁移学习

①：从大量的文本集中学习词嵌入
②：用这些词嵌入模型把他迁移到新的只有少量标注训练集的任务中
③：

词嵌入的特性–类比推理

在这里插入图片描述

嵌入矩阵

目标:学习一个嵌入矩阵E。E乘以one-hot向量会得到嵌入向量。
在这里插入图片描述

学习词嵌入

建立一个语言模型是学习词嵌入的好方法
在这里插入图片描述
1800是6个嵌入向量堆在一起得到的
固定的历史窗口：看预测词的前k个词（k为超参数）

Word2Vec算法----学习一个神经语言模型来得到更好的词嵌入

目标：想要使用这个学习问题来学到一个好的词嵌入模型
在这里插入图片描述
困难：分母基数太大
解决：分级的softmax和负采样

分级的softmax

构建平衡树。采用不同的分级来平衡更常见的词和不那么常见的词，这就解决了Skip-Gram的缺点

Skip-Gram和CBOW对比

在这里插入图片描述

负采样

生成训练集的方法：
在这里插入图片描述
学习从x影射到y的监督学习模型：

负采样:有一个正样本orange和juice，然后会特意生成一系列负样本，所以叫负采样，即用四个负样本训练4个额外的二分类器，在每次迭代中选择4个不同的随机的负样本词去训练算法。

Glove词向量（对比skip-Gram和CBOW）

在这里插入图片描述

情感分析（餐饮评价）

求和或者求平均（嵌入矩阵法）
在这里插入图片描述
用RNN网络（考虑词序）

词嵌入除偏

偏见：人们在实际中存在的歧视被计算机学习到，但是在训练之后要除去
如图
在这里插入图片描述
步骤
1.辨别出想要减少或想要消除的特定偏见的趋势
2.中和步骤
3.均衡步

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
词嵌入

词嵌入-----让算法自动的理解一些类似的词（给一些名词起他上一层的名字，看他们到上一层名字的距离）one-hot的缺点:任何两个one-hot的向量内机为0，无法知道他们的联系和差别，故用特征化的表示来表示每个词，学习这些词的特征和数值词嵌入可视化------把高维的词嵌入数据嵌入到一个二维空间里，这样就可以可视化了。常用的可视化算法是t-SNEs算法使用词嵌入做迁移学习①：从大量的文本...
复制链接

扫一扫

shenzhiping12 CSDN认证博客专家 CSDN认证企业博客

码龄6年

38: 原创

15万+: 周排名

180万+: 总排名

5万+: 访问

: 等级

897: 积分

9: 粉丝

13: 获赞

2: 评论

68: 收藏

私信

关注

热门文章

最新评论

kaldi中文语音识别(1)
IC大白: 楼主你好，那两个链接按不进去了欸

您愿意向朋友推荐“博客详情页”吗？

强烈不推荐
不推荐
一般般
推荐
强烈推荐

提交

最新文章

目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。