大模型刷屏“两会”,景联文科技提供高质量大模型数据

近年来,智能化变革席卷全球,2024年两会政府工作报告首次明确提出实施“人工智能+”行动,特别是大模型等先进技术,在推动产业数智化转型方面的巨大价值已经得到充分认可。

大模型的发展已成为AI领域的重要方向,数据要素作为其重要基石,共同推进智能化时代的到来。

数据的质量与数量直接影响模型性能。在深度学习、自然语言处理等领域,大模型往往需借助亿级数据样本训练,以获取更精确、泛化的知识表示。同时,数据的多样性也推动大模型适应不同场景和需求,以提升模型的通用性和实用性。

大模型的发展也促进了数据要素的深入挖掘和利用,随着大模型在各个领域的应用不断深化,人们对于数据的需求也日益增长。进一步推动了数据采集、存储、处理与分析技术的持续创新,从而实现了数据要素更为高效、精准的利用。

景联文科技是大语言模型数据供应商,致力于为不同阶段的模型算法匹配高质量数据资源。

世界知识期刊及高质量社区文本数据:

  1. 高质量中文期刊
  2. 中文社区文本
  3. 高质量外文文献期刊
  4. 英文高质量电子书
  5. 英文社区文本
  6. 中文数字专利
  7. 英文专利

对话和逻辑:

  1. 文本多轮对话(中文剧本等)
  2. 文本词句扩改润、纠错校对数据(12种错误类型)
  3. 英文多轮对话(英文剧本等)
  4. 猜谜语/脑筋急转弯

题库:

  1. K12教育题库2000万题
  2. 大学职业教育题库1.3亿题
  3. 高质量复杂数学题(应用题、高等数字)1000万题
  4. 英文题库5000万题
  5. 逻辑推理题1000万题
  6. 程序示例代码(代码注释)100万篇

专业文本类数据集

金融类:

  1. 金融学科书籍
  2. 金融试题
  3. 财务类票据
  4. 公司年报、财报
  5. 行业分析报告

医学类:

  1. 中国医学书籍
  2. 医学词典
  3. 医疗门诊病例
  4. 医疗住院病例

教育类:

  1. K12、大学教科书
  2. 教案、课件、解析、练习
  3. 政务类:
  4. 全国各类政策法规(数据+解读)

通用多模态数据集

音频数据:

  1. 普通话(人数 200 万以上,采样率 44.1Khz 及 以上,16bit) 100万小时
  2. 方言 2.7千小时
  3. 图片生成及隐式/显示推理多模态数据:
  4. 图文复杂描述 50万本
  5. 图文推理问答对 400万本
  6.  4K 高清图片 5000万张

视频生成及隐式/显示推理多模态数据:

  1. 视频简单描述
  2. 视频复杂描述
  3. 视频推理问答对

景联文科技|数据采集|数据标注|大语言模型训练数据

助力人工智能技术,赋能传统产业智能化转型升级

文章图文著作权归景联文科技所有,商业转载请联系景联文科技获得授权,非商业转载请注明出处。

  • 1
    点赞
  • 5
    收藏
    觉得还不错? 一键收藏
  • 0
    评论
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值