今日头条中文新闻文本(多层)分类数据集(NLP/文本分类)

这是另一个数据集的加强版,为多级分类,分类更全(含1000+多级分类),量更大。


数据来源:

今日头条客户端


文本多层分类的概念见下图


数据格式:

1000866069|,|tip,news|,|【互联网资讯】PPT设计宝典!十招教你做出拿得出手的PPT|,|互联网,美国,ppt,powerpoint,幻灯片,演示文稿,微软,字体列表|,|
复制代码

每行为一条数据,以|,|分割的各字段,从前往后分别是 新闻ID,分类代码,新闻字符串(仅含标题),新闻关键词,新闻label


所有分类的目录见 all_cat.txt


数据规模:

共2914000条,分布于1000+个多层的类别中。


采集时间:

2018年06月


下载地址

https://github.com/fateleak/toutiao-multilevel-text-classfication-dataset


NLP的同学加我微信吧:


LISCENSE

WTFPL

  • 1
    点赞
  • 7
    收藏
    觉得还不错? 一键收藏
  • 0
    评论

“相关推荐”对你有帮助么?

  • 非常没帮助
  • 没帮助
  • 一般
  • 有帮助
  • 非常有帮助
提交
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值