MinerU PDF Extractor

📄 PDF 智能解析,一键转 Markdown

MinerU 官方 API 封装,将 PDF 转换为结构化 Markdown,支持公式识别、表格提取与 OCR,本地/在线双模式处理。

收藏
5.1k
安装
1.5k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

MinerU PDF Extractor 是基于 MinerU 官方 API 的命令行工具集,提供两种 PDF 解析模式:

本地文件解析(4 步流程):申请上传地址 → 上传文件 → 轮询结果 → 下载解压。适合处理本地存储的 PDF,单文件上限 200MB/600 页。

在线 URL 解析(2 步流程):提交任务 → 轮询并自动下载。直接解析公开可访问的 PDF 链接(如 arXiv、机构官网),省去上传环节,效率更高。

输出包含 full.md(标准 Markdown)、提取的图片、content_list.json(结构化内容)及 layout.json(版面分析数据)。支持中英文自动识别,提供 doclayout_yolo(快)和 layoutlmv3(准)两种版面模型。

显著优点

  • 专业级解析精度:基于 MinerU 开源项目,专门针对学术论文、技术文档优化,公式识别和表格还原能力突出
  • 双模式灵活适配:本地文件用 4 步稳妥处理,在线文件用 2 步高效获取
  • 结构化输出完整:不仅输出 Markdown,还提供 JSON 格式的内容列表和版面数据,便于二次开发
  • 批量处理友好:脚本设计支持循环批量处理,配合 shell 脚本可自动化工作流

潜在缺点与局限性

  • Token 依赖:必须注册 MinerU 账号获取 API Key,存在服务可用性和配额限制
  • 网络依赖:本地解析也需上传至云端处理,非纯离线方案
  • 无原生格式保留:输出为 Markdown,复杂排版(如多栏混排)的还原效果有限
  • 轮询等待:需主动轮询查询结果,无 Webhook 回调机制
  • 商业服务风险:MinerU 为商业 API,长期定价策略和稳定性需关注

适合人群

  • 需要将大量学术论文、技术报告转为 Markdown 的研究者和开发者
  • 构建知识库、RAG 系统的工程师,需要结构化文档数据
  • 处理扫描版 PDF 并需要 OCR 文字识别的用户
  • 熟悉命令行操作、能配置环境变量的技术用户

常规风险

  • API 密钥泄露风险:脚本依赖 MINERU_TOKEN/MINERU_API_KEY 环境变量,需避免硬编码或提交至代码仓库
  • 数据隐私考量:本地文件需上传至 MinerU 服务器处理,敏感文档需谨慎评估
  • 服务中断风险:依赖第三方商业 API,存在服务变更、限速或停服可能
  • 网络超时问题:大文件上传和结果轮询可能因网络不稳定失败,需适当调整重试参数

MinerU PDF Extractor 内容

docs文件夹
scripts文件夹
手动下载zip · 16.3 kB
Local_File_Parsing_Guide.mdtext/markdown
请选择文件