系列文章:
国产PDF智能提取神器:MinerU项目安装运行实践
正文:
项目简介
概述
项目地址:https://github.com/opendatalab/MinerU
MinerU是一款将PDF转化为机器可读格式的工具(如markdown、json),可以很方便地抽取为任意格式。 MinerU诞生于书生-浦语的预训练过程中,项目宣称会集中精力解决科技文献中的符号转化问题,希望在大模型时代为科技发展做出贡献。 相比国内外知名商用产品MinerU还很年轻,如果遇到问题或者结果不及预期请到issue提交问题,同时附上相关PDF。
主要功能
- 删除页眉、页脚、脚注、页码等元素,确保语义连贯
- 输出符合人类阅读顺序的文本,适用于单栏、多栏及复杂排版
- 保留原文档的结构,包括标题、段落、列表等
- 提取图像、图片描述、表格、表格标题及脚注
- 自动识别并转换文档中的公式为LaTeX格式
- 自动识别并转换文档中的表格为HTML格式
- 自动检测扫描版PDF和乱码PDF,并启用OCR功能
- OCR支持84种语言的检测与识别
- 支持多种输出格式,如多模态与NLP的Markdown、按阅读顺序排序的JSON、含有丰富信息的中间格式等
- 支持多种可视化结果,包括layout可视化、span可视化等,便于高效确认输出效果与质检
- 支持纯CPU环境运行,并支持 GPU(CUDA)/NPU(CANN)/MPS 加速
- 兼容Windows、Linux和Mac平台
本地安装运行
一 基础环境说明
说明:这是一个Python项目,以项目中的demo.py运行为例的过程,来说明构建MinerU本地运行环境,并运行代码的过程。
本地基础环境:Windows10、 IntelliJ IDEA、Python 3.10
二 构建本地运行虚拟环境
在IntelliJ IDEA中直接构建Python运行的虚拟环境(python Virtualenv Environment),通过虚拟环境安装运行MinerU相关的依赖库,然后运行demo代码。
通过In