mineru document extractor

📄 智能文档提取 · 一键转 Markdown

办公榜 #41

MinerU 文档提取工具,支持 PDF、Word、PPT、图片等多格式转 Markdown/HTML,提供免登录快速模式与高精度专业模式,内置 OCR 与表格公式识别。

收藏
12.6k
安装
4.5k
版本
0.1.24
CLS 安全扫描中
预计需要 3 分钟...

使用说明

MinerU Document Extractor 综合评估

MinerU 是由 OpenDataLab 开发的开源文档提取工具,通过 CLI 工具 mineru-open-api 提供企业级文档解析能力。该工具核心定位是解决传统 PDF 转文本过程中常见的格式错乱、表格丢失、公式乱码等问题,特别针对学术论文、研究报告等复杂排版文档优化。

核心用法

工具采用双模式架构设计:

Flash-Extract(快速模式):零配置免登录,无需 Token 即可直接使用,适合 10MB 以内、20 页以下的简单文档快速转 Markdown。支持 PDF、图片、Word、PPT 等格式,内置 OCR 能力可处理扫描件。

Precision Extract(专业模式):需配置 API Token,解锁完整功能矩阵:多格式输出(Markdown/HTML/LaTeX/DOCX/JSON)、表格结构识别、LaTeX 公式提取、VLM 视觉语言模型布局分析、批量文件处理(支持通配符与文件列表)、网页爬取转换。提供 vlmpipeline 两种模型选择——前者在复杂版面场景精度更高,后者承诺零幻觉输出。

显著优点

1. 工程成熟度:由上海人工智能实验室 OpenDataLab 团队维护,GitHub 开源生态完整,持续迭代
2. 多语言支持:覆盖 80+ 语言,内置拉丁/阿拉伯/西里尔/天城文等语系专用识别包

3. 架构灵活性:支持私有化部署(--base-url 参数),满足金融、医疗等敏感场景合规需求

4. 渐进式体验:先用免费快速模式验证,再按需升级专业功能,降低首次使用门槛

潜在局限

  • API 依赖:专业功能需联网调用 MinerU 云服务,离线场景需自建私有化集群
  • Token 成本:高频批量处理场景需关注 API 调用配额与计费策略
  • 模型权衡:VLM 模式虽提升复杂版面精度,但存在极低概率的幻觉风险;pipeline 模式保守但可能丢失细微格式
  • 格式边界.doc/.ppt 老格式仅在专业模式支持,flash-extract 仅限新版 Office 格式

适合人群

  • 科研人员:解析 arXiv 论文、提取表格数据与数学公式
  • 数据工程师:搭建文档 ETL 流水线,批量处理企业文档资产
  • 开发者:集成文档解析能力至 RAG、知识库、智能客服等 AI 应用
  • 内容运营:网页内容采集与结构化 Markdown 归档

常规风险

文档内容需上传至 MinerU API 服务器处理,敏感材料建议评估隐私政策或选择私有化部署。Token 需妥善保管(存储于 ~/.mineru/config.yaml 或环境变量),避免泄露导致配额滥用。

mineru document extractor 内容

手动下载zip · 8.0 kB
SKILL.mdtext/markdown
请选择文件