自定义博客皮肤VIP专享

*博客头图:

格式为PNG、JPG,宽度*高度大于1920*100像素,不超过2MB,主视觉建议放在右侧,请参照线上博客头图

请上传大于1920*100像素的图片!

博客底图:

图片格式为PNG、JPG,不超过1MB,可上下左右平铺至整个背景

栏目图:

图片格式为PNG、JPG,图片宽度*高度为300*38像素,不超过0.5MB

主标题颜色:

RGB颜色,例如:#AFAFAF

Hover:

RGB颜色,例如:#AFAFAF

副标题颜色:

RGB颜色,例如:#AFAFAF

自定义博客皮肤

-+

OpenDataLab的博客

公开数据集平台资讯、资源分享

  • 博客(134)
  • 收藏
  • 关注

原创 点石反应数据库全面接入书生·端砚,反应可查、条件可比、原文可验!AI科研“伙伴”更智能

大规模、细粒度、可追溯的AI-Ready反应数据库

2026-09-21 11:27:25 317

原创 厦门大学“先进封装电子电镀配方研发智能体”入选上海 AI 实验室“与书生共创”十大成果,并接入 Sciverse 科学智能数据基座

厦门大学agent 接入 Sciverse 科学智能数据基座

2026-08-24 17:04:45 300

原创 打通AI4S数据入口:MinerU.Chem让化学文献中的“图片”,从“人类可读”走向“AI可用”

欢迎合作探讨

2026-08-17 19:54:06 362

原创 MinerU 大赛 40 强公布:从科研语料到行业应用,看数据智能如何加速落地

快来看看

2026-07-22 16:13:11 252

原创 MinerU 近期更新速览:Hybrid 解析提速,pipeline OCR 接入 PP-OCRv6……

MinerU开源模型发布3.3与3.4版本更新,主要优化包括:1)Hybrid解析引擎新增effort参数,medium模式在精度仅降0.13的情况下显著提升处理速度;2)VLM模型升级至2.5-Pro-2605-1.2B,增强复杂文档解析稳定性并原生支持多语言OCR;3)pipeline后端OCR升级至PP-OCRv6,OCR性能提升11%,处理速度优化100%。同时改进了模型下载和缓存复用体验。在线版已同步更新,默认采用medium模式平衡精度与效率。

2026-07-03 14:42:51 507

原创 MinerU 团队新产品 | Sciverse 科学数据基座,把可信的科学知识接入你的 AI 工作流

摘要: Sciverse由MinerU团队推出,是专为Auto-Research设计的科研数据基座,旨在解决AI科研工作流中的数据可信问题。它整合4.66亿条学术元数据、1.06亿图书及7000万专利记录,提供结构化、可追溯的科学数据,支持Agent通过六类核心API(如语义检索、元数据筛选、图表调用)完成文献综述、证据核验等任务。Sciverse强调数据可验证性,避免AI生成虚假结论,适用于科研Agent、RAG系统、专利分析等场景,推动科研AI从“问答”转向“证据驱动”的工作流。

2026-06-29 15:35:51 279

原创 暴雨也挡不住交流热情,MinerU 开发者线下沙龙上海站圆满收官!

5月24日,MinerU开发者沙龙在上海成功举办,吸引了众多开发者和AI实践者参与。活动围绕科学数据赋能AGI4S展开,重点介绍了Sciverse科学智能数据库的三层数据体系,以及MinerU在文档解析技术上的迭代进展。此外,会议还探讨了科学数据质量评测体系的重要性,强调了解析准确性和检索相关性的关键作用。现场交流环节气氛热烈,参与者就实际应用场景提出具体问题。本次活动促进了开发者与MinerU团队的深度互动,为未来技术发展和生态建设提供了宝贵反馈。

2026-06-02 16:32:21 221

原创 MinerU-Popo来了:让文档解析从“看懂每页”走向“读懂整篇”

从 MinerU2.5 到 MinerU-Popo,文档解析正在从单页精度竞争,进一步走向文档级语义结构恢复。前者让模型更准确地看懂页面,后者让系统更完整地读懂整篇文档。面向未来,复杂文档能否高质量转化为 AI-Ready 数据,将直接影响大模型应用的可用性。MinerU-Popo 正是在这条链路上补上关键一环:让页面级 OCR 输出,真正变成可检索、可分析、可进入智能工作流的文档结构。

2026-06-02 14:45:08 637

原创 干货满满丨MinerU 3.0 系列更新:一次不止于模型的全面进化

本地升级,即可使用

2026-04-30 14:11:54 574

原创 GPT-image2 生图,NanaDraw 精修:这才是 AI 绘图的完整答案

NanaDraw是一款AI驱动的科研职场绘图神器,能够快速生成可编辑的学术配图。它支持四种智能模式(自动/草稿/生成/组装),200+内置学术风格,1000+专业图标素材,通过自然语言指令即可生成流程图、机制图等专业图表。独特优势在于生成后仍可自由编辑每个元素,支持导出SVG/PNG/PPT等高清格式,完美解决论文配图卡顿、AI生图不可调等痛点。适用于科研论文、基金标书、职场汇报等场景,实现AI生成与人工微调的无缝结合。

2026-04-27 12:54:13 915

原创 干货满满丨MinerU 3.0 系列更新:一次不止于模型的全面进化

本地升级,即可使用

2026-04-21 16:52:31 548

原创 带你搞定 MinerU 模型本地部署 | MinerU实战训练营第二课上线,直播答疑预约,速来

为你准备了全套免费课程视频、学习文档与实战资料,更有算力支持、专业导师直播答疑,以及结营证书认证,助你快速补齐从 MinerU “会用”到“实战”的关键技能,真正完成从“工具使用者”到“AI 应用构建者”的跃迁。这一期,我们特别邀请了 2 位重磅讲师为大家详解、示范如何进行MinerU 及 MinerU-HTML 模型本地部署,并且在本周四为大家带来集中的线上直播答疑。完成学习后,在「提交」板块提交对应课程任务,完成作业打卡。(点击“立即报名”按钮,注册账号后进入比赛专区,选择“!(课程及作业入口示意)

2026-04-02 11:58:41 421

原创 MinerU文档探索器:告别文档翻找噩梦,为OpenClaw装上火眼金睛

面对个人电脑或云盘里堆积如山的各类文件,每次填报表单、汇总信息时,是不是都感觉像大海捞针一样耗时费力?其实,不仅我们觉得头疼,连 OpenClaw/Agent 也觉得棘手。当 OpenClaw 面对多份、动辄上百页的 PDF,需要快速找到关键信息时,它会怎么做?在没有工具的情况下,OpenClaw 需要一页一页啃文档,甚至重复“造轮子”。这种纯靠“硬读”来尝试完成任务的方式,不仅效率低,而且成本很高。今天,预览版开源!

2026-04-02 11:55:20 702

原创 零代码搞定复杂票据|MinerU Skills 票据处理实战教程

极简上手:一键安装 + 自然语言指令,小白也能快速操作高保真解析:公式、表格关键信息 1:1 还原批量高效:论文批量处理,大幅提升效率开箱即用:输出格式标准,直接对接财务系统等应用场景。

2026-04-01 11:50:34 102

原创 ​零代码搞定论文|MinerU Skills 论文解析实战教程​

极简上手:一键安装 + 自然语言指令,小白也能快速操作高保真解析:公式、表格关键信息 1:1 还原批量高效:论文批量处理,大幅提升效率开箱即用:输出格式标准,直接对接知识库等应用场景。

2026-04-01 11:46:35 101

原创 MinerU-Diffusion发布:我们想重新回答,文档 OCR 到底该怎么做

图5:文档 OCR 逆渲染推理过程在不同解码方法下的概述。模型将二维文档图像映射为一维的 token 序列,并通过自回归方法和基于扩散的方法进行解码。对我们而言,

2026-03-30 16:59:38 699

原创 科学智能数据库 Sciverse 正式发布:让科学数据成为 Agent 可调用的资源

当前,科学数据与模型训练需求之间仍然存在明显鸿沟。大量关键科学信息分布在论文正文、图表、公式、结构表达和实验过程之中,天然具有多模态、强专业性和高复杂度等特征,难以直接进入模型训练流程。现有科学数据体系往往停留在原始汇聚、粗粒度清洗或单一模态处理层面,难以支撑科学大模型对结构、关系和过程的深入理解与演进。为解决上述问题,上海人工智能实验室在日前举办的第二届浦江AI学术年会上,正式发布了科学智能数据库。

2026-03-30 16:53:42 836

原创 一句话,让你的[特殊字符]看懂PDF,MinerU 官方 Skill 来了!附赠开发者“全家桶”

是一款免费开源的文档解析引擎,专门解决这个问题——版面分析、表格识别、公式提取、OCR 一手包办,把任何"难啃"的文档变成 AI 能直接使用的结构化 Markdown。这些文档,普通工具根本啃不动。提供了不同颗粒度的集成路径——无论你是想快速验证、深度集成,还是构建生产级应用,都能找到最顺手的方式。等在内的完整开发者生态:一套工具,覆盖从 Agent 对话到生产部署的全场景,支持便捷调用、集成。深度集成,在加载阶段直接完成解析+分块,每个 chunk 携带原始页码、版面类型、位置信息。

2026-03-24 16:46:11 593

原创 领跑 AI-Ready 数据赛道:MinerU 全面深度适配主流国产算力,持续扩容生态版图

持续扩大算力兼容版图,通过与 DeepLink 团队及多家算力厂家的合作,针对不同架构的优化,能够实现在各类算力平台上实现稳定、高效的运行,有效解决了算力兼容性难题。团队、 DeepLink 团队及国产芯片厂家携手,先后完成了昇腾、平头哥、沐曦、海光、燧原、摩尔线程、天数智芯、寒武纪、昆仑芯、太初元碁、壁仞等 10 余家主流国产算力的适配。的核心价值在于其跨行业的普适性与极高的解析精度。,深耕 AGI4S 前沿领域,致力于攻克复杂文献与多维科学数据的解析难题,为科研创新筑牢数据根基。深度集成于业务流程。

2026-03-01 00:30:00 1102

原创 如何科学地“设计”微调数据?一次关于后训练数据价值评测平台(ODA)的完整验证

在大模型后训练阶段,SFT(监督微调)数据的构建至关重要。然而,长期以来,这一过程业界的通行做法往往依赖“直觉”或“试错”,即多收一点、再筛一轮、训一次模型、看下效果,然后再调整。这个过程不仅成本高昂,而且很难回答一个根本性问题——哪些数据是真的“有用”的,为什么?为了摆脱“盲盒式”微调,急需建立一套科学的数据效能评估方法,用以成为数据生产的“指南针”。

2026-02-28 00:45:00 879

原创 告别手动录入!MinerU KIE功能上线,三步搞定票据关键信息提取

它基于先进的文档解析与大模型技术,提供了一套精准、灵活、可信的智能信息处理流水线,能够准确理解发票、票据、表单等文档的复杂布局,支持按不同的业务需求,自由定义需要提取的字段,输出清晰、可信的结构化结果。有没有一种方式,不仅能灵活、精准、批量、高效地提取票据表单中的关键信息,更能将这些提取出的结构化数据,直接用于构建企业知识库、开发智能业务助手(Agent)或进行深度的数据分析,让每一份文档都发挥更大的价值?● 票据场景:可批量提取发票号码、税号、日期、购销方、商品名称、数量、单价、价税合计等信息。

2026-02-28 00:30:00 1714

原创 MinerU再次更新,网页解析功能上线!URL一键变Markdown,文档处理再无边界

导言:各位的铁粉们,你们的“生产力神兵”又进化了!还在为DeepResearch获取网页信息、网页知识库构建、复杂网页内容提取、网页文章复制乱码等场景感到头疼吗?在 AI 数据处理领域,以和为代表的行业先行者已经为我们展示了“网页转 LLM 友好格式”的巨大潜力,这次我们直接把深度优化的“网页解析”功能装进了网页端与桌面端,凭借在公式、表格识别上的深厚积淀,让整个互联网都成为你的 AI-Ready 语料库!今天,我们边上手边拆解,带你玩转。

2026-02-27 00:15:00 2061

原创 ScienceMetaBench 开源:建立科学文献元数据提取的客观评测基准

导言:从科学文献 PDF 文档中提取作者、年份、摘要等元数据,构建高效索引与分析,并以此激活海量文档价值,能够直接帮助研究者、图书馆、企业及数据库平台等实现更高效的文献管理、资源数字化、AI知识库构建与数据聚合分析等。然而,面对排版复杂、元素多样的科学文献,如何客观地评估模型的元数据提取能力?为此,上海人工智能实验室 OpenDataLab 团队推出了科学文献元数据提取评测集,该基准旨在建立客观、统一的评估标准,助力社区衡量与比较各类前沿方法的实际性能。

2026-02-27 00:15:00 1594

原创 总激励200万!2026 MinerU数据智能与前沿语料挑战赛正式启幕,筑基 AGI4S 高质量语料新高地!

在 AGI 爆发的前夜,作为“模塑申城语料普惠计划”的核心环节,今日正式启幕!本次大赛以构建「AI-Ready 数据」为核心驱动,旨在依托开源智能文档解析引擎 MinerU,深耕 AGI4S 前沿领域,致力于攻克复杂文献与多维科学数据的解析难题,为科研创新筑牢数据根基。同时,大赛紧扣产业转型需求,通过精准解析非结构化数据,加速行业应用场景的深度转化,全方位助力各类组织机构释放数据要素的战略价值。我们寻找能够挖掘非结构化数据深层价值、破解复杂数据解析难题的你!

2026-02-26 17:09:05 1097

原创 『面向AGI4S,构建下一代数据基础设施』上海AI实验室青年科学家入选第五届“上海科技青年35人引领计划”

何聪辉,清华大学博士,上海人工智能实验室青年科学家,数据平台中心负责人,长期深耕高性能计算与AI 据基础设施的交叉前沿,致力于构建面向通用人工智能的下一代数据基座。其构建的AI数据基座,覆盖“底层技术-评测标准-开源生态”的完整体系,为AGI的演进筑牢了关键的数据基石。何聪辉带领团队围绕“面向AI-Ready的下一代大模型数据基础设施”开展系统性、原创性研究,不仅填补了国际数据基础设施领域的多项技术空白,更推动了全球大模型数据生态的开源化与标准化,为解决AGI发展的数据瓶颈提供了可落地的中国方案。

2026-02-26 15:22:36 476

原创 OpenDataArena全面升级版正式上线,四大核心模块重构数据价值评估新格局

(文章发布于2025年12月23日)导言:为破解长期以来学界与业界的困局,上海人工智能实验室(上海AI实验室)OpenDataLab团队在今年8月开源了首个全面、公正的后训练数据价值评测平台——。该项目致力于将数据选择从“盲目试错”的炼丹术,转变为一门可复现、可分析、可累积的严谨科学。在初版系统发布后的数月间,项目通过团队内部及小范围社区用户的深度使用,完成了高强度的技术验证与功能打磨。伴随着评测规模、工具链和分析能力的持续扩展,近期,,该项目面向全体开发者开放。

2026-02-26 15:19:22 933

原创 超实用!MinerU新增3个新功能,支持文档逐块修正

功能。上传 PDF 时,您可以精准指定需要解析的页码区间。想看哪里解哪里,可以让转换提取速度大幅提升。

2026-02-26 15:04:08 510

原创 打破桎梏!MinerU-HTML重构网页提取范式,开源超大规模高质量多语言语料AICC

摘要:上海AI实验室OpenDataLab团队提出新一代网页提取工具MinerU-HTML,通过两阶段语义感知方法解决传统HTML提取的局限性。该工具首先用0.6B参数模型标注正文节点,再精细处理代码、公式等结构化元素,最终输出Markdown格式。基于此构建的AICC语料库(7.3万亿tokens)在多项测试中超越RefinedWeb等现有语料,尤其在通用知识和阅读理解任务上表现突出。实验证明高质量提取比激进过滤策略更有效,为大规模预训练提供了新标杆。团队开源了相关工具、模型及数据集,推动AI数据生态建设

2026-02-26 14:20:11 589

原创 MinerU2.5大模型发布了,有亿点点不一样

从评测结果来看,在权威的OmniDocBench基准测试中,MinerU2.5取得结果最优(SOTA),在布局检测、文本识别、表格识别、公式识别等关键指标上超越Gemini 2.5-Pro、GPT-4o等国际顶尖模型,对比开源文档解析方案(如MonkeyOCR、PP-StructureV3),MinerU2.5在解析精度、结构完整性和格式自然度方面同样处于优势地位。下一步,团队将持续拓展国际国内主流平台和开发工具的适配覆盖,进一步加强与重点行业应用的深度融合,打造更加开放、兼容、可扩展的技术生态体系。

2025-09-30 17:16:20 2002

原创 高性能文档解析引擎MinerU再升级,全方位刷新行业SOTA,全面助力AI Ready数据自由

具体来说,Miner2.5在复杂文档处理上的进步,体现在结构还原与语义理解的双重提升。未来,团队将继续拓展更广泛的软件生态,不仅涵盖更多国内外主流 AI 平台和开发工具,也将加强与垂直行业应用的深度融合,打造开放、兼容、可扩展的技术生态体系,以支持更丰富的应用场景和更高效的产业落地。MinerU 2.5独辟蹊径,采用首创的“二阶段”解析架构,同时支持原生分辨率处理,从根源上最大限度地降低了信息失真的概率,实现了对复杂文档又快又准的解析效果,在显著减少“幻觉”现象的同时,大幅提升了解析结果的可靠性。

2025-09-28 16:02:59 1395

原创 MinerU2.5! 公式、表格解析统统不在话下!

之前我们发布了MinerU2.5模型,包含网页端/桌面客户端端/api 在内点MinerU 全线产品已经集成了最新模型,这波直接把文档解析做到天花板 💯。📚 无论科研、金融还是教育场景,MinerU 都能帮你轻松搞定高质量文档解析,为知识库构建省时又省力!更赞的是 👉 中文公式、复杂数学公式、嵌套表格都做了深度优化!✅ 无线/少线表格一键解析。

2025-09-28 15:33:57 698

原创 告别“炼丹玄学”:上海AI实验室推出首个大模型数据竞技场OpenDataArena

数据在AI时代的重要性已经不言而喻,但悬而未决的是——如何精确量化这些数据的价值、辨别其优劣?为此,上海人工智能实验室OpenDataLab团队在数据领域持续深耕,正式推出了。地址:https://opendataarena.github.io/index.html工具:https://github.com/OpenDataArena/OpenDataArena-Tool数据:https://huggingface.co/OpenDataArena展开来说,在海量的SFT(监督式微调)

2025-08-29 18:56:02 989 1

原创 战略科学家对话:AI+科学,数据和人才是关键

针对当前生命科学领域文本类数据已经“不够用”的现实困境,孙勇奎分享了解决思路,“进一步挖掘人类的生物数据并同步建立新数据生成机制,可以更好地开展AI训练,甚至让AI自行检索全球科研成果,提出更具潜力的假说并加以验证,进而提高药物研发成功率。罗毅介绍了合肥实验室的“AI化学家”,经过三年的迭代,它已经能自动完成80%的化学实验。他还分享了一则案例,实验室一名偏理论研究的同学,在AI的辅助下,仅用六个月便研发出了一款具有领先性的防阻燃材料,“由此看来,AI能够帮助科学家实现跨学科的重大发现”。

2025-08-29 18:45:05 846

原创 MinerU又双叒更新了!化学解析×多模式翻译等多种功能上线!文档解析处理爽到飞起!

翻译功能,想怎么翻就怎么翻!全文翻译、模块翻译,多种模式随心切换,满足你所有的翻译姿势!系统默认接入限时免费的GPT-4o-mini引擎,同时支持接入DeepL、Google、DeepSeek、硅基流动、阿里云百炼、腾讯混元等主流翻译服务,满足不同用户的翻译需求。你的反馈会直接驱动我们的解析模型优化,让你成为MinerU的“秘密武器”!近期,MinerU就像是坐上了火箭,功能蹭蹭往上涨,简直要让你的文档处理体验“爽”到飞起!现在你可以选择页码范围解析,只关注你最关心的部分,降低解析成本,效率直线飙升!

2025-08-12 18:09:31 1493 1

原创 上海AI实验室发布MinerU2:通专融合路线如何补齐AI-Ready数据的最后一公里

随着模型技术发展,互联网数据趋同性导致通用大模型同质化,细分专业化成为深入行业落地的必然路径,这些数据常存在于私域,且以文档形式最为普遍。,支撑高质量AI-Ready的语料构建管线,将可解析场景延伸至科学数据领域,补齐AI-Ready数据的最后一公里,缩窄AGI促进科学发现的鸿沟,现已成为『书生』科学多模态大模型Intern-S1开源工具链中的重要一环。性能、速度跃升的同时,将可解析场景延伸至科学数据领域,补齐AI-Ready数据的最后一公里,缩窄AGI促进科学发现的鸿沟,已成为。

2025-08-12 17:19:53 1253

原创 斩获ACL 2025最佳主题论文奖丨Meta-rater 框架,1% 算力锁定大模型最优数据

第63届国际计算语言学协会年(ACL 2025)于7月27日至8月1日在奥地利维也纳举行。作为NLP领域最具影响力的顶级盛会,今年的ACL依然吸引了全球众多顶尖学者参与,投稿数量与质量再创新高。在本届大会上,由上海人工智能实验室OpenDataLab团队与华东师范大学团队联合提出的研究成果Meta-rater框架聚焦于提升大语言模型预训练的数据筛选效率,相比以往依赖大规模试错的“黑箱式”方法,Meta-rater显著降低了算力开销,并通过多维度质量评估体系打破传统筛选标准的局限。

2025-08-12 17:12:38 1278

原创 官宣!MinerU 正式接入和鲸 ModelWhale,加速科研进程!

近日,大模型文档语料生产引擎双方联合升级的功能在 ModelWhale 平台全新升级发布会上正式亮相!此次合作将 MinerU 强大的文档解析能力深度集成至 ModelWhale 智能工具中,为科研工作提供坚实数据支持。

2025-08-12 17:04:30 499

原创 AI“压力面”,DeepSeek性能暴跌近30% | 上海AI Lab&清华&人大

摘要:上海人工智能实验室、清华大学等团队提出REST框架,通过同时测试多个问题对大模型进行"压力测试"。研究发现,在GSM8K等7个基准测试中,即便顶级模型如DeepSeek-R1,在多重问题压力下性能骤降近30%。REST有效解决了传统评测区分度低、成本高、脱离现实的问题,揭示了模型在预算分配、抗干扰等方面的不足,特别发现"过度思考"是性能下降主因。该研究为开发更强大的推理模型提供了新思路,相关代码和数据集已开源。

2025-07-28 15:58:51 1262

原创 ACL 2025|MathFusion题目融合框架出炉,让大模型数学推理能力倍增

MathFusion提出了一种创新的数学数据增强方法,通过融合不同数学问题来提升大模型的推理能力。该方法采用顺序、并列和条件三种融合策略,将原始问题组合成结构更复杂的新问题,从而增强模型处理关联性问题的能力。实验表明,仅需45K合成指令,MathFusion就能使模型在多个基准测试中平均准确率提升18.0个百分点,展现出卓越的数据效率和性能。该研究为提升大模型的复杂推理能力提供了新思路,相关成果已被ACL 2025接收。

2025-07-28 15:56:28 1222

原创 新工具开源!Vis3大模型数据可视化利器:填 AK/SK 直接预览 S3 数据,JSON/视频/图片秒开!本地文件也可用

通过其智能识别数据结构、交互式可视化的能力,使数据以网页、Markdown、图片等视图模式清晰呈现,关键字段一目了然,大幅降低数据理解成本,助力用户快速洞察数据价值。无论是进行数据展示,还是深度分析挖掘,都能找到契合的呈现方式,让数据理解更透彻。灵活高效的数据接入方式,让你摆脱数据读取的繁琐和限制,专注于可视化分析。工具通过智能解析引擎自动识别数据结构,再配以精巧的可视化布局,将复杂数据中的关键信息以可视化的方式清晰呈现,显著节省用户在数据预览和理解过程中所耗费的时间与精力,让数据解读更高效。

2025-07-11 08:30:00 1044

空空如也

空空如也

TA创建的收藏夹 TA关注的收藏夹

TA关注的人

提示
确定要删除当前文章?
取消 删除