在spaCy V3.0中用自训练词向量来训练文本分类模型

在spaCy V3.0中用自训练词向量来训练文本分类模型

前文《spaCy V3.0 文本分类模型训练、评估、打包及数据预处理》中采用的是spaCy提供的预训练词向量—“zh_core_web_lg”。《使用Gensim在专业领域、高相关性、小语料库上训练词向量》在自定义语料上训练出了自己的词向量。

如何使用自己训练的词向量来训练文本分类模型?

1 保存并转换词向量

model = FastText.load('fasttext.bin')
model.wv.save_word2vec_format('fasttext_100.txt')

2 将fasttext_100.txt压缩为vectors.zip文件,并拷贝到文本分类工程的assets目录下

3 修改文本分类工程的project.yml文件:

commands:

  • name: init-vectors
    help: Download vectors and convert to model
    script:
    • “python -m spacy init vectors zh assets/vectors.zip assets/zh_fasttext_vectors”
      deps:
    • “assets/vectors.zip”
      outputs_no_cache:
    • “assets/zh_fasttext_vectors”

4 在文本分类工程目录的命令行下执行:

spacy project run init-vectors

结果:

================================ init-vector
  • 0
    点赞
  • 3
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值