核心用法
MinerU PDF Extractor 是基于 MinerU 官方 API 的命令行工具集,提供两种 PDF 解析模式:
本地文件解析(4 步流程):申请上传地址 → 上传文件 → 轮询结果 → 下载解压。适合处理本地存储的 PDF,单文件上限 200MB/600 页。
在线 URL 解析(2 步流程):提交任务 → 轮询并自动下载。直接解析公开可访问的 PDF 链接(如 arXiv、机构官网),省去上传环节,效率更高。
输出包含 full.md(标准 Markdown)、提取的图片、content_list.json(结构化内容)及 layout.json(版面分析数据)。支持中英文自动识别,提供 doclayout_yolo(快)和 layoutlmv3(准)两种版面模型。
显著优点
- 专业级解析精度:基于 MinerU 开源项目,专门针对学术论文、技术文档优化,公式识别和表格还原能力突出
- 双模式灵活适配:本地文件用 4 步稳妥处理,在线文件用 2 步高效获取
- 结构化输出完整:不仅输出 Markdown,还提供 JSON 格式的内容列表和版面数据,便于二次开发
- 批量处理友好:脚本设计支持循环批量处理,配合 shell 脚本可自动化工作流
潜在缺点与局限性
- Token 依赖:必须注册 MinerU 账号获取 API Key,存在服务可用性和配额限制
- 网络依赖:本地解析也需上传至云端处理,非纯离线方案
- 无原生格式保留:输出为 Markdown,复杂排版(如多栏混排)的还原效果有限
- 轮询等待:需主动轮询查询结果,无 Webhook 回调机制
- 商业服务风险:MinerU 为商业 API,长期定价策略和稳定性需关注
适合人群
- 需要将大量学术论文、技术报告转为 Markdown 的研究者和开发者
- 构建知识库、RAG 系统的工程师,需要结构化文档数据
- 处理扫描版 PDF 并需要 OCR 文字识别的用户
- 熟悉命令行操作、能配置环境变量的技术用户
常规风险
- API 密钥泄露风险:脚本依赖
MINERU_TOKEN/MINERU_API_KEY环境变量,需避免硬编码或提交至代码仓库 - 数据隐私考量:本地文件需上传至 MinerU 服务器处理,敏感文档需谨慎评估
- 服务中断风险:依赖第三方商业 API,存在服务变更、限速或停服可能
- 网络超时问题:大文件上传和结果轮询可能因网络不稳定失败,需适当调整重试参数