MinerU PDF Extractor

📄 PDF 智能解析,一键转 Markdown

开源社区开发的 MinerU API 封装工具,支持本地与在线 PDF 转 Markdown,含公式识别、表格提取与 OCR 功能

收藏
4.6k
安装
1.5k
版本
1.0.2
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

MinerU PDF Extractor 是一套基于 Shell 脚本的命令行工具集,用于调用 MinerU API 将 PDF 文档转换为结构化 Markdown。提供两条独立工作流:

本地文件解析(4 步):申请上传 URL → 上传文件 → 轮询结果 → 下载解压
在线 URL 解析(2 步):提交任务 → 轮询并自动下载

输出包含 full.md(主文档)、images/(提取图片)、content_list.json(结构化内容)及 layout.json(版式分析数据)。支持中英文自动检测,可选 doclayout_yolo(快速)或 layoutlmv3(精准)两种版式模型。

显著优点

  • 格式还原能力强:专为学术/技术文档优化,复杂公式、多栏表格、图文混排识别效果优于通用 OCR
  • 双模式灵活:本地文件最大支持 200MB/600 页,在线模式省去上传等待(10-20 秒 vs 30-60 秒)
  • 批处理友好:Shell 脚本设计便于 for 循环自动化,输出目录结构清晰
  • 技术栈轻量:仅依赖 curl/unzip,可选 jq 增强解析
  • 安全设计:包含输入校验与 JSON 注入防护,Token 强制走环境变量

潜在缺点与局限性

  • 第三方 API 依赖:需注册 MinerU 账号获取 Token,存在服务可用性与定价变动风险
  • 社区非官方:非 MinerU 官方维护,API 变更可能导致脚本失效
  • 大文件体验:200MB 上限对扫描版古籍或高分辨率图册可能不足
  • 网络门槛:国内用户访问 mineru.net 需考虑连通性
  • 无图形界面:纯命令行,对非技术用户门槛较高

适合人群

学术研究者、知识管理重度用户、需要批量处理 PDF 入库的开发者、RAG/LLM 应用构建者

常规风险

  • API Token 泄露:硬编码会暴露凭证,需严格使用环境变量
  • 敏感文档外泄:PDF 内容上传至第三方云服务,机密材料慎用
  • URL 可访问性:在线模式要求源地址公网可达,内网/鉴权资源无法直接使用
  • 成本失控:未提及免费额度与计费规则,批量运行前需确认用量限制

MinerU PDF Extractor 内容

docs文件夹
scripts文件夹
手动下载zip · 29.2 kB
Local_File_Parsing_Guide.mdtext/markdown
请选择文件