核心用法
MinerU PDF Extractor 是一套基于 Shell 脚本的命令行工具集,用于调用 MinerU API 将 PDF 文档转换为结构化 Markdown。提供两条独立工作流:
本地文件解析(4 步):申请上传 URL → 上传文件 → 轮询结果 → 下载解压
在线 URL 解析(2 步):提交任务 → 轮询并自动下载
输出包含 full.md(主文档)、images/(提取图片)、content_list.json(结构化内容)及 layout.json(版式分析数据)。支持中英文自动检测,可选 doclayout_yolo(快速)或 layoutlmv3(精准)两种版式模型。
显著优点
- 格式还原能力强:专为学术/技术文档优化,复杂公式、多栏表格、图文混排识别效果优于通用 OCR
- 双模式灵活:本地文件最大支持 200MB/600 页,在线模式省去上传等待(10-20 秒 vs 30-60 秒)
- 批处理友好:Shell 脚本设计便于 for 循环自动化,输出目录结构清晰
- 技术栈轻量:仅依赖 curl/unzip,可选 jq 增强解析
- 安全设计:包含输入校验与 JSON 注入防护,Token 强制走环境变量
潜在缺点与局限性
- 第三方 API 依赖:需注册 MinerU 账号获取 Token,存在服务可用性与定价变动风险
- 社区非官方:非 MinerU 官方维护,API 变更可能导致脚本失效
- 大文件体验:200MB 上限对扫描版古籍或高分辨率图册可能不足
- 网络门槛:国内用户访问 mineru.net 需考虑连通性
- 无图形界面:纯命令行,对非技术用户门槛较高
适合人群
学术研究者、知识管理重度用户、需要批量处理 PDF 入库的开发者、RAG/LLM 应用构建者
常规风险
- API Token 泄露:硬编码会暴露凭证,需严格使用环境变量
- 敏感文档外泄:PDF 内容上传至第三方云服务,机密材料慎用
- URL 可访问性:在线模式要求源地址公网可达,内网/鉴权资源无法直接使用
- 成本失控:未提及免费额度与计费规则,批量运行前需确认用量限制