如何使用中文维基百科语料

最新推荐文章于 2023-06-02 08:47:17 发布

远洋号

最新推荐文章于 2023-06-02 08:47:17 发布

阅读量1.1k

点赞数

本文链接：https://blog.csdn.net/s3FRH3JyN6yymHmT11/article/details/78362158

版权

本文介绍了如何使用中文维基百科的语料库进行自然语言处理，包括下载Wikipedia Dump，数据抽取，二次处理，繁体转简体以及分词等步骤。推荐使用Wikipedia Extractor和opencc工具进行初步处理和繁体到简体的转换，同时也提到了jieba分词库的应用。

摘要由CSDN通过智能技术生成

前言

在做自然语言处理时很多时候都会需要中文语料库，高质量的中文语料库较难找，维基百科和百度百科算是比较不错的语料库。其中维基百科会定时将语料库打包发布 https://dumps.wikimedia.org/zhwiki/ ，可以下载最新版本的语料库。而百度百科则需要自己去爬，不过也有人把爬好的语料贡献出来了，https://pan.baidu.com/share/init?surl=i3wvfil提取码 neqs 。

这篇文章主要讲下如何使用中文维基百科的语料库。

Wikipedia Dump

通过 https://dumps.wikimedia.org/zhwiki/latest/zhwiki-latest-pages-articles.xml.bz2 可以下载最新的中文维基百科语料，目前大小为1.37G左右，里面内容以xml格式保存，所以我们后续还是需要做处理的。xml节点信息类似如下

<page>
<title></title>
<id></id>
<timestamp></timestamp>
<username></username>
<comment></comment>
<text xml:space="preserve"></text>
</page>

根据标签名容易知道各个节点内容表示的意义，text节点为文章内容，它里面其实还包含了很多其他的一些符号，也是需要过滤掉的。

抽取数据

对于上述下载的语料库，需要进一步抽取，可以选择
* 自己写程序抽取。

最低0.47元/天解锁文章

远洋号

关注

0
点赞
踩
2

收藏

觉得还不错? 一键收藏
0
评论
复制链接

分享到 QQ

分享到新浪微博

扫一扫