利用word2vec对关键词进行聚类

最新推荐文章于 2024-06-22 09:36:27 发布

这个图是PS的吧

最新推荐文章于 2024-06-22 09:36:27 发布

阅读量973

点赞数 1

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/qq_43685315/article/details/86715407

版权

利用word2vec对关键词进行聚类

摘要由CSDN通过智能技术生成

继上次提取关键词之后，项目组长又要求我对关键词进行聚类。说实话，我不太明白对关键词聚类跟新闻推荐有什么联系，不过他说什么我照做就是了。

按照一般的思路，可以用新闻ID向量来表示某个关键词，这就像广告推荐系统里面用用户访问类别向量来表示用户一样，然后就可以用kmeans的方法进行聚类了。不过对于新闻来说存在一个问题，那就量太大，如果给你十万篇新闻，那每一个关键词将需要十万维的向量表示，随着新闻数迅速增加，那维度就更大了，这计算起来难度太大。于是，这个方法思路简单但是不可行。

好在我们有word2vec这个工具，这是google的一个开源工具，能够仅仅根据输入的词的集合计算出词与词直接的距离，既然距离知道了自然也就能聚类了，而且这个工具本身就自带了聚类功能，很是强大。下面正式介绍如何使用该工具进行词的分析，关键词分析和聚类自然也就包含其中了。word2vec官网地址看这里：https://code.google.com/p/word2vec/

1、寻找语料

要分析，第一步肯定是收集数据，这里不可能一下子就得到所有词的集合，最常见的方法是自己写个爬虫去收集网页上的数据。不过，如果不需要实时性，我们可以使用别人提供好的网页数据，例如搜狗2012年6月到7月的新闻数据：http://www.sogou.com/labs/dl/ca.html 直接下载完整版，注册一个帐号，然后用ftp下载，ubuntu下推荐用filezilla

下载得到的数据有1.5G

2、分词

我们得到的1.5的数据是包含一些html标签的，我们只需要新闻内容，也就是content其中的值。首先可以通过简单的命令把非content的标签干掉

cat news_tensite_xml.dat | iconv -f gbk -t utf-8 -c | grep "<content>"  > corpus.txt

得到了corpus.txt文件只含有content标签之间的内容，再对内容进行分词即可，这里推荐使用之前提到过的ANSJ，没听过的看这里：

最低0.47元/天解锁文章

这个图是PS的吧

关注

1
点赞
踩
4

收藏

觉得还不错? 一键收藏
0
评论
利用word2vec对关键词进行聚类

利用word2vec对关键词进行聚类
复制链接

扫一扫

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。