中英文语料公开数据集大全

最新推荐文章于 2024-05-21 12:54:10 发布

二哥不像程序员

最新推荐文章于 2024-05-21 12:54:10 发布

阅读量5k

点赞数 2

分类专栏：数据挖掘文章标签：自然语言处理 nlp 对话系统

版权声明：本文为博主原创文章，遵循 CC 4.0 BY-SA 版权协议，转载请附上原文出处链接和本声明。

本文链接：https://blog.csdn.net/qq_35164554/article/details/108484764

版权

数据挖掘专栏收录该内容

40 篇文章 18 订阅

订阅专栏

用于对话系统的中英文语料数据，点击超链接直接进入即可。

中文电影对白语料

中文电影对白语料，噪音比较大，许多对白问答关系没有对应好

短消息语料

包含中文和英文短信息语料，据说是世界最大公开的短消息语料

中文聊天语料

ChatterBot聊天引擎提供的一点基本中文聊天语料，量很少，但质量比较高

NLP相关数据集

这是他人收集的自然语言处理相关数据集，主要包含Question Answering，Dialogue Systems， Goal-Oriented Dialogue Systems三部分，都是英文文本。可以使用机器翻译为中文，供中文对话使用

小黄鸡语料

传说中的小黄鸡预料：xiaohuangji50w_fenciA.conv.zip （已分词）和 xiaohuangji50w_nofenci.conv.zip （未分词）

论坛问答语料

由白鹭时代官方论坛问答板块10,000+ 问题中，选择被标注了“最佳答案”的纪录汇总而成。人工review raw data，给每一个问题，一个可以接受的答案。目前，语料库只包含2907个问答。

其他语料

chat corpus collection from various open sources
包括：开放字幕、英文电影字幕、中文歌词、英文推文

保险行业QA语料

通过翻译 insuranceQA产生的数据集。train_data含有问题12,889条，数据 141779条，正例：负例 = 1:10； test_data含有问题2,000条，数据 22000条，正例：负例 = 1:10；valid_data含有问题2,000条，数据 22000条，正例：负例 = 1:10

二哥不像程序员

关注

2
点赞
踩
12

收藏

觉得还不错? 一键收藏
打赏
0
评论
中英文语料公开数据集大全

用于对话系统的中英文语料数据，点击超链接直接进入即可。中文电影对白语料中文电影对白语料，噪音比较大，许多对白问答关系没有对应好短消息语料包含中文和英文短信息语料，据说是世界最大公开的短消息语料中文聊天语料ChatterBot聊天引擎提供的一点基本中文聊天语料，量很少，但质量比较高NLP相关数据集这是他人收集的自然语言处理相关数据集，主要包含Question Answering，Dialogue Systems， Goal-Oriented Dialogue Systems三部分，都是
复制链接

扫一扫

专栏目录

评论

被折叠的条评论为什么被折叠?

到【灌水乐园】发言

查看更多评论

添加红包

成就一亿技术人!

hope_wisdom

发出的红包

打赏作者

二哥不像程序员 你的鼓励将是我创作的最大动力

¥1 ¥2 ¥4 ¥6 ¥10 ¥20

扫码支付：¥1

获取中

扫码支付

您的余额不足，请更换扫码支付或充值

实付元

使用余额支付

点击重新获取

扫码支付

钱包余额 0

抵扣说明：

1.余额是钱包充值的虚拟货币，按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载，可以购买VIP、付费专栏及课程。