NLP 学习 task1_3. THUCNews数据集下载和探索

最新推荐文章于 2024-08-17 22:50:48 发布

沐漜

最新推荐文章于 2024-08-17 22:50:48 发布

阅读量2.4k

点赞数 1

分类专栏： NLP 文章标签： NLP 数据探索

本文链接：https://blog.csdn.net/zyq11223/article/details/90145100

版权

这篇博客介绍了如何获取和处理THUCNews新闻文本分类数据集，该数据集包含10个类别，共65000条新闻。通过数据预处理，将数据划分为训练集、验证集和测试集，并提供了相关脚本以生成所需文件。

摘要由CSDN通过智能技术生成

数据集

这里采用了清华NLP组提供的THUCNews新闻文本分类数据集的一个子集（原始的数据集大约74万篇文档，训练起来需要花较长的时间）。数据集请自行到THUCTC：一个高效的中文文本分类工具包下载，请遵循数据提供方的开源协议。

本次训练使用了其中的10个分类，每个分类6500条，总共65000条新闻数据。

类别如下：

体育, 财经, 房产, 家居, 教育, 科技, 时尚, 时政, 游戏, 娱乐
1
数据集划分如下：

训练集: 500010
验证集: 50010
测试集: 1000*10
从原数据集生成子集的过程请参看helper下的两个脚本。其中，copy_data.sh用于从每个分类拷贝6500个文件，cnews_group.py用于将多个文件整合到一个文件中。执行该文件后，得到三个数据文件：

cnews.train.txt: 训练集(50000条)
cnews.val.txt: 验证集(5000条)
cnews.test.txt: 测试集(10000条)

# coding: utf-8

import sys
from collections import Counter

import numpy as np
import tensorflow.contrib.keras as kr

if sys.version_info[0] > 2:
    is_py3 = True
else:
    reload(sys)
    sys.setdefaultencoding("utf-8")
    is_py3 = False


def native_word(word, encoding='utf-8'):
    """如