使用词向量分析关键字语义的相似度 Python版本

最新推荐文章于 2024-04-15 16:04:13 发布

Zhaozetu

最新推荐文章于 2024-04-15 16:04:13 发布

阅读量2.4k

点赞数 2

分类专栏：大数据分析 Python Hadoop 文章标签： python 自然语言词向量神经网络

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/Zhaozetu/article/details/52468920

版权

本文通过Python利用gensim实现词向量，以《兽血沸腾.txt》为数据源，计算关键词的相似度，解释词向量在自然语言处理中的应用，探讨word2vec的原理。

摘要由CSDN通过智能技术生成

准备工作

安装jieba分词工具 pip install jieba
安装gensim pip install gensim
下载小说《兽血沸腾.txt》自己百度之

实验目的

以《兽血沸腾.txt》的每一行为一篇文档，得到对应关键词的词向量，计算其中部分关键词的相似度。主要是熟悉词向量的使用场景。

背景知识介绍

什么是词向量？

词向量是自然语言理解中一种语言模型的副产品。所谓语言模型，其实就是将人类识别的语言转变为机器可以分析和处理的对象。传统的语言模型称为“词袋子模型”，一篇文章被分解为N个词的组合，进一步表示为一个M维度的向量，每个维度是字典中的一个词，如果这个词在文章中出现则表示为1，否则表示为0。
从语言建模的角度看，词向量使用的是n-gram模型，认为一篇文章当中不同的词之间存在关系，这种关系体现在这个词与出现在这个词之前和之后的若干个词之间，从概率的角度说，也就是这篇文章中这个词出现的概率可以近似等于该词与其关联词出现的条件概率。
从表示形式上看，词向量与传统语言模型的不同之处在于，传统语言模型是一个M维度的向量，向量中每一项的值为0或者1，而词向量维度更低，一般设定为几百维，并且每一项的值为一个实数。

如何获得词向量？

已有多种方法可以获取，我们这里使用最Fashion的神经网络方法。简单说一下原理：
（1）基于n-gram模型
（2）目标：最大化关键词的条件概率

最低0.47元/天解锁文章

关注

2
点赞
踩
12

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。