<?xml version="1.0" encoding="utf-8" ?><rss version="2.0"><channel><title><![CDATA[OpenDataLab的博客]]></title><description><![CDATA[公开数据集平台资讯、资源分享]]></description><link>https://blog.csdn.net/OpenDataLab</link><language>zh-cn</language><generator>https://blog.csdn.net/</generator><copyright><![CDATA[Copyright &copy; OpenDataLab]]></copyright><item><title><![CDATA[点石反应数据库全面接入书生·端砚，反应可查、条件可比、原文可验！AI科研“伙伴”更智能]]></title><link>https://blog.csdn.net/OpenDataLab/article/details/166139126</link><guid>https://blog.csdn.net/OpenDataLab/article/details/166139126</guid><author>OpenDataLab</author><pubDate>Mon, 21 Sep 2026 11:27:25 +0800</pubDate><description><![CDATA[大规模、细粒度、可追溯的AI-Ready反应数据库]]></description><category></category></item><item><title><![CDATA[厦门大学“先进封装电子电镀配方研发智能体”入选上海 AI 实验室“与书生共创”十大成果，并接入 Sciverse 科学智能数据基座]]></title><link>https://blog.csdn.net/OpenDataLab/article/details/164027611</link><guid>https://blog.csdn.net/OpenDataLab/article/details/164027611</guid><author>OpenDataLab</author><pubDate>Mon, 24 Aug 2026 17:04:45 +0800</pubDate><description><![CDATA[厦门大学agent 接入 Sciverse 科学智能数据基座]]></description><category></category></item><item><title><![CDATA[打通AI4S数据入口：MinerU.Chem让化学文献中的“图片”，从“人类可读”走向“AI可用”]]></title><link>https://blog.csdn.net/OpenDataLab/article/details/163831385</link><guid>https://blog.csdn.net/OpenDataLab/article/details/163831385</guid><author>OpenDataLab</author><pubDate>Mon, 17 Aug 2026 19:54:06 +0800</pubDate><description><![CDATA[欢迎合作探讨]]></description><category></category></item><item><title><![CDATA[MinerU 大赛 40 强公布：从科研语料到行业应用，看数据智能如何加速落地]]></title><link>https://blog.csdn.net/OpenDataLab/article/details/163107417</link><guid>https://blog.csdn.net/OpenDataLab/article/details/163107417</guid><author>OpenDataLab</author><pubDate>Wed, 22 Jul 2026 16:13:11 +0800</pubDate><description><![CDATA[快来看看]]></description><category></category></item><item><title><![CDATA[MinerU 近期更新速览：Hybrid 解析提速，pipeline OCR 接入 PP-OCRv6……]]></title><link>https://blog.csdn.net/OpenDataLab/article/details/162552219</link><guid>https://blog.csdn.net/OpenDataLab/article/details/162552219</guid><author>OpenDataLab</author><pubDate>Fri, 03 Jul 2026 14:42:51 +0800</pubDate><description><![CDATA[MinerU开源模型发布3.3与3.4版本更新，主要优化包括：1）Hybrid解析引擎新增effort参数，medium模式在精度仅降0.13的情况下显著提升处理速度；2）VLM模型升级至2.5-Pro-2605-1.2B，增强复杂文档解析稳定性并原生支持多语言OCR；3）pipeline后端OCR升级至PP-OCRv6，OCR性能提升11%，处理速度优化100%。同时改进了模型下载和缓存复用体验。在线版已同步更新，默认采用medium模式平衡精度与效率。]]></description><category></category></item><item><title><![CDATA[MinerU 团队新产品 | Sciverse 科学数据基座，把可信的科学知识接入你的 AI 工作流]]></title><link>https://blog.csdn.net/OpenDataLab/article/details/162423644</link><guid>https://blog.csdn.net/OpenDataLab/article/details/162423644</guid><author>OpenDataLab</author><pubDate>Mon, 29 Jun 2026 15:35:51 +0800</pubDate><description><![CDATA[摘要： Sciverse由MinerU团队推出，是专为Auto-Research设计的科研数据基座，旨在解决AI科研工作流中的数据可信问题。它整合4.66亿条学术元数据、1.06亿图书及7000万专利记录，提供结构化、可追溯的科学数据，支持Agent通过六类核心API（如语义检索、元数据筛选、图表调用）完成文献综述、证据核验等任务。Sciverse强调数据可验证性，避免AI生成虚假结论，适用于科研Agent、RAG系统、专利分析等场景，推动科研AI从“问答”转向“证据驱动”的工作流。]]></description><category></category></item><item><title><![CDATA[暴雨也挡不住交流热情，MinerU 开发者线下沙龙上海站圆满收官！]]></title><link>https://blog.csdn.net/OpenDataLab/article/details/161628526</link><guid>https://blog.csdn.net/OpenDataLab/article/details/161628526</guid><author>OpenDataLab</author><pubDate>Tue, 02 Jun 2026 16:32:21 +0800</pubDate><description><![CDATA[5月24日，MinerU开发者沙龙在上海成功举办，吸引了众多开发者和AI实践者参与。活动围绕科学数据赋能AGI4S展开，重点介绍了Sciverse科学智能数据库的三层数据体系，以及MinerU在文档解析技术上的迭代进展。此外，会议还探讨了科学数据质量评测体系的重要性，强调了解析准确性和检索相关性的关键作用。现场交流环节气氛热烈，参与者就实际应用场景提出具体问题。本次活动促进了开发者与MinerU团队的深度互动，为未来技术发展和生态建设提供了宝贵反馈。]]></description><category></category></item><item><title><![CDATA[MinerU-Popo来了：让文档解析从“看懂每页”走向“读懂整篇”]]></title><link>https://blog.csdn.net/OpenDataLab/article/details/161624440</link><guid>https://blog.csdn.net/OpenDataLab/article/details/161624440</guid><author>OpenDataLab</author><pubDate>Tue, 02 Jun 2026 14:45:08 +0800</pubDate><description><![CDATA[从 MinerU2.5 到 MinerU-Popo，文档解析正在从单页精度竞争，进一步走向文档级语义结构恢复。前者让模型更准确地看懂页面，后者让系统更完整地读懂整篇文档。面向未来，复杂文档能否高质量转化为 AI-Ready 数据，将直接影响大模型应用的可用性。MinerU-Popo 正是在这条链路上补上关键一环：让页面级 OCR 输出，真正变成可检索、可分析、可进入智能工作流的文档结构。]]></description><category></category></item><item><title><![CDATA[干货满满丨MinerU 3.0 系列更新：一次不止于模型的全面进化]]></title><link>https://blog.csdn.net/OpenDataLab/article/details/160658860</link><guid>https://blog.csdn.net/OpenDataLab/article/details/160658860</guid><author>OpenDataLab</author><pubDate>Thu, 30 Apr 2026 14:11:54 +0800</pubDate><description><![CDATA[本地升级，即可使用]]></description><category></category></item><item><title><![CDATA[GPT-image2 生图，NanaDraw 精修：这才是 AI 绘图的完整答案]]></title><link>https://blog.csdn.net/OpenDataLab/article/details/160551406</link><guid>https://blog.csdn.net/OpenDataLab/article/details/160551406</guid><author>OpenDataLab</author><pubDate>Mon, 27 Apr 2026 12:54:13 +0800</pubDate><description><![CDATA[NanaDraw是一款AI驱动的科研职场绘图神器，能够快速生成可编辑的学术配图。它支持四种智能模式（自动/草稿/生成/组装），200+内置学术风格，1000+专业图标素材，通过自然语言指令即可生成流程图、机制图等专业图表。独特优势在于生成后仍可自由编辑每个元素，支持导出SVG/PNG/PPT等高清格式，完美解决论文配图卡顿、AI生图不可调等痛点。适用于科研论文、基金标书、职场汇报等场景，实现AI生成与人工微调的无缝结合。]]></description><category></category></item><item><title><![CDATA[干货满满丨MinerU 3.0 系列更新：一次不止于模型的全面进化]]></title><link>https://blog.csdn.net/OpenDataLab/article/details/160376168</link><guid>https://blog.csdn.net/OpenDataLab/article/details/160376168</guid><author>OpenDataLab</author><pubDate>Tue, 21 Apr 2026 16:52:31 +0800</pubDate><description><![CDATA[本地升级，即可使用]]></description><category></category></item><item><title><![CDATA[带你搞定 MinerU 模型本地部署 | MinerU实战训练营第二课上线，直播答疑预约，速来]]></title><link>https://blog.csdn.net/OpenDataLab/article/details/159759946</link><guid>https://blog.csdn.net/OpenDataLab/article/details/159759946</guid><author>OpenDataLab</author><pubDate>Thu, 02 Apr 2026 11:58:41 +0800</pubDate><description><![CDATA[为你准备了全套免费课程视频、学习文档与实战资料，更有算力支持、专业导师直播答疑，以及结营证书认证，助你快速补齐从 MinerU “会用”到“实战”的关键技能，真正完成从“工具使用者”到“AI 应用构建者”的跃迁。这一期，我们特别邀请了 2 位重磅讲师为大家详解、示范如何进行MinerU 及 MinerU-HTML 模型本地部署，并且在本周四为大家带来集中的线上直播答疑。完成学习后，在「提交」板块提交对应课程任务，完成作业打卡。（点击“立即报名”按钮，注册账号后进入比赛专区，选择“！（课程及作业入口示意）]]></description><category></category></item><item><title><![CDATA[MinerU文档探索器：告别文档翻找噩梦，为OpenClaw装上火眼金睛]]></title><link>https://blog.csdn.net/OpenDataLab/article/details/159759844</link><guid>https://blog.csdn.net/OpenDataLab/article/details/159759844</guid><author>OpenDataLab</author><pubDate>Thu, 02 Apr 2026 11:55:20 +0800</pubDate><description><![CDATA[面对个人电脑或云盘里堆积如山的各类文件，每次填报表单、汇总信息时，是不是都感觉像大海捞针一样耗时费力？其实，不仅我们觉得头疼，连 OpenClaw/Agent 也觉得棘手。当 OpenClaw 面对多份、动辄上百页的 PDF，需要快速找到关键信息时，它会怎么做？在没有工具的情况下，OpenClaw 需要一页一页啃文档，甚至重复“造轮子”。这种纯靠“硬读”来尝试完成任务的方式，不仅效率低，而且成本很高。今天，预览版开源！]]></description><category></category></item><item><title><![CDATA[零代码搞定复杂票据｜MinerU Skills 票据处理实战教程]]></title><link>https://blog.csdn.net/OpenDataLab/article/details/159723786</link><guid>https://blog.csdn.net/OpenDataLab/article/details/159723786</guid><author>OpenDataLab</author><pubDate>Wed, 01 Apr 2026 11:50:34 +0800</pubDate><description><![CDATA[极简上手：一键安装 + 自然语言指令，小白也能快速操作高保真解析：公式、表格关键信息 1:1 还原批量高效：论文批量处理，大幅提升效率开箱即用：输出格式标准，直接对接财务系统等应用场景。]]></description><category></category></item><item><title><![CDATA[​零代码搞定论文｜MinerU Skills 论文解析实战教程​]]></title><link>https://blog.csdn.net/OpenDataLab/article/details/159723537</link><guid>https://blog.csdn.net/OpenDataLab/article/details/159723537</guid><author>OpenDataLab</author><pubDate>Wed, 01 Apr 2026 11:46:35 +0800</pubDate><description><![CDATA[极简上手：一键安装 + 自然语言指令，小白也能快速操作高保真解析：公式、表格关键信息 1:1 还原批量高效：论文批量处理，大幅提升效率开箱即用：输出格式标准，直接对接知识库等应用场景。]]></description><category></category></item><item><title><![CDATA[MinerU-Diffusion发布：我们想重新回答，文档 OCR 到底该怎么做]]></title><link>https://blog.csdn.net/OpenDataLab/article/details/159651495</link><guid>https://blog.csdn.net/OpenDataLab/article/details/159651495</guid><author>OpenDataLab</author><pubDate>Mon, 30 Mar 2026 16:59:38 +0800</pubDate><description><![CDATA[图5：文档 OCR 逆渲染推理过程在不同解码方法下的概述。模型将二维文档图像映射为一维的 token 序列，并通过自回归方法和基于扩散的方法进行解码。对我们而言，]]></description><category></category></item><item><title><![CDATA[科学智能数据库 Sciverse 正式发布：让科学数据成为 Agent 可调用的资源]]></title><link>https://blog.csdn.net/OpenDataLab/article/details/159651417</link><guid>https://blog.csdn.net/OpenDataLab/article/details/159651417</guid><author>OpenDataLab</author><pubDate>Mon, 30 Mar 2026 16:53:42 +0800</pubDate><description><![CDATA[当前，科学数据与模型训练需求之间仍然存在明显鸿沟。大量关键科学信息分布在论文正文、图表、公式、结构表达和实验过程之中，天然具有多模态、强专业性和高复杂度等特征，难以直接进入模型训练流程。现有科学数据体系往往停留在原始汇聚、粗粒度清洗或单一模态处理层面，难以支撑科学大模型对结构、关系和过程的深入理解与演进。为解决上述问题，上海人工智能实验室在日前举办的第二届浦江AI学术年会上，正式发布了科学智能数据库。]]></description><category></category></item><item><title><![CDATA[一句话，让你的[特殊字符]看懂PDF，MinerU 官方 Skill 来了！附赠开发者“全家桶”]]></title><link>https://blog.csdn.net/OpenDataLab/article/details/159428837</link><guid>https://blog.csdn.net/OpenDataLab/article/details/159428837</guid><author>OpenDataLab</author><pubDate>Tue, 24 Mar 2026 16:46:11 +0800</pubDate><description><![CDATA[是一款免费开源的文档解析引擎，专门解决这个问题——版面分析、表格识别、公式提取、OCR 一手包办，把任何"难啃"的文档变成 AI 能直接使用的结构化 Markdown。这些文档，普通工具根本啃不动。提供了不同颗粒度的集成路径——无论你是想快速验证、深度集成，还是构建生产级应用，都能找到最顺手的方式。等在内的完整开发者生态：一套工具，覆盖从 Agent 对话到生产部署的全场景，支持便捷调用、集成。深度集成，在加载阶段直接完成解析+分块，每个 chunk 携带原始页码、版面类型、位置信息。]]></description><category></category></item><item><title><![CDATA[领跑 AI-Ready 数据赛道：MinerU 全面深度适配主流国产算力，持续扩容生态版图]]></title><link>https://blog.csdn.net/OpenDataLab/article/details/158428275</link><guid>https://blog.csdn.net/OpenDataLab/article/details/158428275</guid><author>OpenDataLab</author><pubDate>Sun, 01 Mar 2026 00:30:00 +0800</pubDate><description><![CDATA[持续扩大算力兼容版图，通过与 DeepLink 团队及多家算力厂家的合作，针对不同架构的优化，能够实现在各类算力平台上实现稳定、高效的运行，有效解决了算力兼容性难题。团队、 DeepLink 团队及国产芯片厂家携手，先后完成了昇腾、平头哥、沐曦、海光、燧原、摩尔线程、天数智芯、寒武纪、昆仑芯、太初元碁、壁仞等 10 余家主流国产算力的适配。的核心价值在于其跨行业的普适性与极高的解析精度。，深耕 AGI4S 前沿领域，致力于攻克复杂文献与多维科学数据的解析难题，为科研创新筑牢数据根基。深度集成于业务流程。]]></description><category></category></item><item><title><![CDATA[如何科学地“设计”微调数据？一次关于后训练数据价值评测平台（ODA）的完整验证]]></title><link>https://blog.csdn.net/OpenDataLab/article/details/158427514</link><guid>https://blog.csdn.net/OpenDataLab/article/details/158427514</guid><author>OpenDataLab</author><pubDate>Sat, 28 Feb 2026 00:45:00 +0800</pubDate><description><![CDATA[在大模型后训练阶段，SFT（监督微调）数据的构建至关重要。然而，长期以来，这一过程业界的通行做法往往依赖“直觉”或“试错”，即多收一点、再筛一轮、训一次模型、看下效果，然后再调整。这个过程不仅成本高昂，而且很难回答一个根本性问题——哪些数据是真的“有用”的，为什么？为了摆脱“盲盒式”微调，急需建立一套科学的数据效能评估方法，用以成为数据生产的“指南针”。]]></description><category></category></item></channel></rss>