jieba分词以及word2vec词语相似度

最新推荐文章于 2024-08-04 11:11:47 发布

coding-v

最新推荐文章于 2024-08-04 11:11:47 发布

阅读量474

点赞数

分类专栏： NLP 文章标签：算法深度学习机器学习 python nlp

本文链接：https://blog.csdn.net/qq_33805714/article/details/109247757

版权

NLP 专栏收录该内容

2 篇文章 0 订阅

订阅专栏

去除标点符号，

下一步 开始文本相似度计算：

Doc2Vec,Word2Vec文本相似度：https://blog.csdn.net/qq_33805714/article/details/109247752

from gensim.models import Word2Vec 
model = Word2Vec(sentences, sg=1, size=100, window=5, min_count=5, negative=3, sample=0.001, hs=1, workers=4)
参数解释：
1.sg=1是skip-gram算法，对低频词敏感；默认sg=0为CBOW算法。
2.size是输出词向量的维数，值太小会导致词映射因为冲突而影响结果，值太大则会耗内存并使算法计算变慢，一般值取为100到200之间。
3.window是句子中当前词与目标词之间的最大距离，3表示在目标词前看3-b个词，后面看b个词(b在0-3之间随机)。
4.min_count是对词进行过滤，频率小于min-count的单词则会被忽视，默认值为5。
5.negative和sample可根据训练结果进行微调，sample表示更高频率的词被随机下采样到所设置的阈值，默认值为1e-3。
6.hs=1表示层级softmax将会被使用，默认hs=0且negative不为0，则负采样将会被选择使用。
7.workers控制训练的并行，此参数只有在安装了Cpython后才有效，否则只能使用单核。

from gensim.models import word2vec

参考文章： http://www.jb51.net/article/139690.htm ， https://blog.csdn.net/YmeBtc/article/details/102527799

coding-v

关注

0
点赞
踩
0

收藏

觉得还不错? 一键收藏
0
评论
jieba分词以及word2vec词语相似度

去除标点符号，下一步开始文本相似度计算：参考文章： http://www.jb51.net/article/139690.htmfrom gensim.models import Word2Vec model = Word2Vec(sentences, sg=1, size=100, window=5, min_count=5, negative=3, sample=0.0...
复制链接

扫一扫