MinerU Doc Parser

📄 智能文档提取,一键转 Markdown

基于 MinerU API 的文档提取 CLI 工具,支持 PDF/图片/网页转换为 Markdown/HTML/LaTeX/DOCX,提供免 Token 快速模式和精准提取模式,内置表格/公式识别与 OCR 能力。

收藏
4.8k
安装
2.1k
版本
1.0.10
CLS 安全性认证2026-08-12
点击查看完整报告 >

使用说明

核心用法

MinerU 是一个命令行文档提取工具,通过 MinerU API 将 PDF、图片、网页等转换为结构化格式。提供两种主要工作模式:

1. flash-extract(免 Token 快速模式)

  • 无需登录,零配置快速上手
  • 支持 Markdown 单格式输出
  • 限制:10MB 文件大小、20 页以内
  • 适合临时使用、简单文档、快速预览

2. extract(精准提取模式)

  • 需 API Token(免费注册获取)
  • 支持 md/html/latex/docx/json 多格式输出
  • 支持批量处理、OCR、表格/公式识别
  • 更高文件尺寸和页数上限
  • 提供 vlm(高精度)和 pipeline(无幻觉)两种模型

常用命令示例

# 快速提取(免 Token)
mineru-open-api flash-extract document.pdf

# 精准提取(需 Token)
mineru-open-api extract document.pdf -f md,html -o ./output/

# 网页爬取
mineru-open-api crawl https://example.com/article

# 批量处理
mineru-open-api extract *.pdf -o ./results/

显著优点

1. 双模式设计:免 Token 快速模式降低使用门槛,精准模式满足生产需求
2. 多格式支持:原生支持学术常用的 LaTeX、DOCX 及结构化 JSON

3. 智能识别:内置表格、公式、OCR 能力,无需额外工具链

4. 批量与管道支持:适合自动化工作流和大规模文档处理

5. 中文优化:默认中文语言包,支持 60+ 种语言识别

6. 模型可选:vlm 模式适合复杂排版,pipeline 模式保证零幻觉

潜在局限

1. 云端依赖:必须联网调用 MinerU API,无法离线使用
2. Token 门槛:高级功能需注册获取 API Token,有一定上手成本

3. 文件限制:免费模式限制严格(10MB/20页),大文档需付费或分片

4. 格式损失:极复杂排版(如杂志、海报)转换效果可能不理想

5. hallucination 风险:vlm 模式在罕见场景下可能产生幻觉文本

适合人群

  • 研究人员:快速提取论文 PDF 为 Markdown/LaTeX 用于笔记整理
  • 开发者:构建文档处理流水线,批量转换技术文档
  • 内容运营:网页内容爬取与结构化存档
  • 知识管理用户:将本地文档库转为可检索的 Markdown 格式

常规风险

  • API 服务可用性:依赖第三方服务,存在服务中断或限速风险
  • 数据隐私敏感:文档内容需上传至云端处理,机密文件需谨慎
  • Token 管理:Token 泄露可能导致配额被盗用,建议定期轮换
  • 输出质量波动:扫描件、手写体、复杂表格的识别准确率因文档而异

安全解读

核心用法

MinerU 提供两种提取模式:`flash-extract`(免 Token 快速模式)和 `extract`(精准模式)。

快速上手:无需注册,直接运行 mineru-open-api flash-extract <file> 即可将 PDF、图片或简单文档转换为 Markdown,单次限制 10MB/20页,适合临时使用。

精准提取:通过 mineru-open-api auth 配置 Token 后,使用 extract 命令解锁完整功能:

  • 多格式输出:Markdown、HTML、LaTeX、DOCX、JSON
  • 高级识别:表格提取、公式渲染(LaTeX)、OCR 扫描件识别
  • 批量处理:支持通配符 *.pdf--list 文件列表批量转换
  • 网页抓取:crawl 命令将任意网页转为结构化 Markdown
  • 模型选择:--model vlm 适合复杂布局学术文档,--model pipeline 保证零幻觉

典型工作流:小文件直接 flash-extract → 大文件/复杂需求申请 Token → 批量场景用 extract --list → 网页内容用 crawl

显著优点

1. 零门槛体验flash-extract 免登录、免配置,5 秒上手,降低初次使用成本。

2. 格式覆盖全面:从 PDF/图片到 Markdown/HTML/LaTeX/DOCX 全链路转换,满足学术写作、网页归档、内容迁移等多场景。

3. 专业文档解析:针对学术论文优化,支持公式 LaTeX 还原、复杂表格结构保留,OCR 识别扫描件中的文字与排版。

4. 灵活的部署选项:官方提供云端 API(本 Skill 默认)和本地部署版本,敏感数据可私有化处理。

5. 批量与管道友好:支持 shell 管道 cat doc.pdf | mineru-open-api extract --stdin,便于脚本集成和自动化工作流。

潜在缺点与局限性

1. 云端依赖与隐私顾虑extract/crawl 需上传文档至 mineru.net 云端处理,敏感文档存在数据出境风险,需自行评估合规性。

2. 功能分层限制:免登录模式仅支持 Markdown 输出、10MB/20页上限,大文档或需要多格式输出时必须申请 Token。

3. Token 管理成本:生产环境需维护 API Token,存在配置持久化(~/.mineru/config.yaml)和权限管理问题。

4. 模型选择权衡vlm 模型虽精度更高但存在极低概率的幻觉风险;pipeline 模型保守但可能丢失复杂排版细节。

5. 网络与速率限制:企业 NAT 环境下 flash-extract 的 IP 限频容易触发;大文件处理依赖稳定网络,超时需手动调整。

适合的目标群体

  • 学术研究者:快速提取 PDF 论文内容、转换 LaTeX 公式、整理文献笔记
  • 内容创作者:将网页、PDF 资料转为 Markdown 用于博客、知识库建设
  • 开发者/自动化工程师:集成文档处理流水线,批量转换企业文档库
  • 知识管理用户:构建个人/团队文档中心,统一多源资料格式
  • 轻度用户:临时需要"PDF 转文字",不愿注册复杂服务

使用风险

  • 数据隐私风险:云端处理模式下,文档内容上传至第三方服务器,敏感信息可能面临泄露或合规审计问题;建议机密文档使用本地部署版本。
  • 可用性风险flash-extract 的 IP 限频在企业/公共网络环境下易触发;API Token 过期或配额耗尽将导致服务中断。
  • 供应链风险:依赖外部 mineru-open-api CLI 二进制,需保持更新以获取安全补丁;npm/Go 包源虽可信但仍需防范供应链攻击。
  • 提取质量波动:扫描件 OCR 准确率受图像质量影响;复杂版式文档可能出现结构错乱,需人工校验关键内容。
  • 凭证安全:Token 本地存储需确保 ~/.mineru/ 目录权限正确(0700),避免多用户环境泄露。

MinerU Doc Parser 内容

手动下载zip · 8.1 kB
CONTRIBUTING.mdtext/markdown
请选择文件