wiki语料库处理

训练英文词向量的时候希望用wiki语料库,但是官方给的文件只有.xml格式,解压后无法直接另存为txt文件(会告诉你文件过大,无法用记事本打开),搜索资料发现大家用的都是gensim自带的WikiCorpus来处理,源代码如下:

from gensim.corpora import WikiCorpus
 
if __name__ == '__main__':
 
    inp="enwiki-latest-pages-articles.xml.bz2"##注意这里必须数.bz2,不能是自己手动解压后的文件,原因可以参考https://blog.csdn.net/Sonya_/article/details/103390787
    i = 0
    output_file="wiki_englist_%07d.txt"%i
 
 
    output = open(output_file, 'w',encoding="utf-8")
    wiki = WikiCorpus(inp, dictionary={})
    for text in wiki.get_texts():
        output.write(" ".join(text) + "\n")
        i = i + 1
        if (i % 10000 == 0):
            output.close()
            output_file = "wiki_englist_%07d.txt" % i
            output = open(output_file, 'w', encoding="utf-8")
            print("Save "+str(i) + " articles")
    output.close()

切记输入的文件后缀名应该是.xml.bz2
这串代码是每隔10000个字就保存一个文件,如果不嫌文档过大,可以不用if语句后的内容,直接用如下代码

from gensim.corpora import WikiCorpus
 
if __name__ == '__main__':
 
    inp="enwiki-latest-pages-articles.xml.bz2"##注意这里必须数.bz2,不能是自己手动解压后的文件,原因可以参考https://blog.csdn.net/Sonya_/article/details/103390787
    output_file="wiki_englist.txt"
 
 
    output = open(output_file, 'w',encoding="utf-8")
    wiki = WikiCorpus(inp, dictionary={})
    for text in wiki.get_texts():
        output.write(" ".join(text) + "\n")
    output.close()
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值