MinerU zero-setup document extraction — convert PDFs, images, Word, and PowerPoint to Markdown instantly. No login, no token, no configuration. Just run and get results

⚡ 零配置文档秒转 Markdown

零配置文档提取工具,支持PDF、图片、Word、PPT一键转Markdown,无需登录注册,即装即用。

收藏
5.5k
安装
1.1k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

mineru-fast 是基于 OpenDataLab MinerU 生态的轻量级文档提取 CLI 工具,通过 flash-extract 命令实现即时文档转换。支持本地文件路径或远程 URL 输入,输出为结构化 Markdown,自动保存关联图片。

基础命令结构:

mineru-open-api flash-extract <文件或URL> [选项]

关键参数:

  • -o/--output:指定输出路径(默认 stdout)
  • --language:文档语言包(默认 ch 中英文,支持 10+ 语系)
  • --pages:页码范围筛选(如 1-10
  • --timeout:超时设置(默认 900 秒)

支持格式: PDF、PNG/JPG/WEBP/GIF/BMP、DOCX、PPTX,以及上述格式的远程 URL。

---

显著优点

1. 零配置体验:无需 API Token、账号注册或复杂配置,安装即用,大幅降低使用门槛
2. 多格式覆盖:单一工具处理办公文档、扫描件、演示文稿全场景

3. 多语言 OCR:内置 40+ 语种识别,特别优化中文、繁体、日文、韩文及印度语系

4. 智能输出管理:未指定 -o 时自动生成规范目录(~/MinerU-Skill/<name>_<hash>/),避免文件混乱

5. 开源可信:Apache-2.0 许可,源码公开(GitHub),由 OpenDataLab 背书

---

潜在缺点与局限性

1. 网络依赖:依赖远程 API 服务,离线环境无法使用
2. 速率限制:存在 HTTP 429 限流机制,高频调用可能触发等待

3. 大文件瓶颈:超时默认 900 秒,超大文档可能需手动延长 --timeout

4. 格式限制:不支持 .doc(旧版 Word)、.ppt(旧版 PPT)、加密 PDF

5. 无批处理:需逐个文件执行,无内置批量目录处理命令

---

适合人群

  • 开发者/自动化脚本用户:需要快速集成文档解析流水线
  • 内容编辑/知识管理用户:将本地文档库批量转为 Markdown 入库
  • researchers:处理学术论文 PDF 及扫描件 OCR
  • 隐私敏感用户:不愿上传文件至商业闭云服务,偏好开源方案

---

常规风险

| 风险点 | 说明 | 缓解建议 |
|--------|------|---------|
| 数据外传 | 文件上传至 MinerU 服务器处理 | 避免上传含敏感个人信息、商业机密或受版权保护的文档 |
| 解析质量波动 | 复杂排版、手写体、低分辨率扫描件识别率下降 | 指定正确 `--language`,对关键文档人工复核 |
| 服务可用性 | 依赖第三方基础设施 | 关键业务场景准备本地备选方案(如原始 MinerU 本地部署) |
| 版本漂移 | CLI 与远程 API 版本可能不完全同步 | 定期执行 `npm install -g mineru-open-api@latest` 保持更新 |

MinerU zero-setup document extraction — convert PDFs, images, Word, and PowerPoint to Markdown instantly. No login, no token, no configuration. Just run and get results 内容

手动下载zip · 3.6 kB
SKILL.mdtext/markdown
请选择文件