使用GloVe(c语言版)训练自定义语料

最新推荐文章于 2021-10-08 16:43:40 发布

weixin_30498807

最新推荐文章于 2021-10-08 16:43:40 发布

阅读量140

点赞数

文章标签：人工智能 c/c++

原文链接：http://www.cnblogs.com/echo-cheng/p/8561171.html

版权

1.准备语料

将分好词的语料保存为×××.txt

2.准备源码

下载地址：https://github.com/stanfordnlp/GloVe，解压后将语料×××.txt添加到GloVe-master文件夹下

3.修改训练语料地址

打开demo.sh文件，由于默认是下载TXT8作为语料，故将这段代码删除，并修改CORPUS=×××.txt，最终文件内容如下：

其他应该都可以自行修改。

4.执行

打开终端，进入GloVe-master文件后：

(1)make

(2)./demo.sh

5.修改词向量文件

训练后会得到vetors.txt，打开后在第一行加上vacob_size vector_size，这样才能用word2vec的load函数加载成功

vacob_size vector_size可在训练时看到：

6.加载使用巽寮的词向量

1 from gensim.models import Word2Vec  
2   
3 model = Word2Vec.load_word2vec_format(‘vectors.txt’, binary=False)

接下来的使用就和word2vec一样

转载于:https://www.cnblogs.com/echo-cheng/p/8561171.html

关注