pdf-parser-mineru

📄 本地PDF智能解析专家

基于本地MinerU的PDF解析工具,支持将PDF转换为Markdown、JSON等机器可读格式,保留文档结构、公式、表格及图像,支持OCR与109种语言识别。

收藏
6.6k
安装
2.2k
版本
1.0.2
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

该技能提供两个核心工具:pdf_to_markdownpdf_to_json,基于开源的 MinerU 引擎实现 PDF 文档的智能解析。

pdf_to_markdown 将 PDF 转换为 Markdown 格式,保留文档结构层级、数学公式(LaTeX 格式)、表格及图像,输出包含完整内容、图片路径、表格信息和公式统计的 JSON 结构。适合知识库构建、内容再发布和版本控制场景。

pdf_to_json 提供更细粒度的结构化输出,包含页面尺寸、文本块类型与坐标(bbox)、图像/表格/公式数组及文档元数据(作者、标题等),适合下游程序化处理和版面分析任务。

关键参数配置

  • backend:三种引擎可选
  • hybrid-auto-engine(默认):精度与速度平衡
  • pipeline:纯 CPU 运行,兼容性最佳
  • vlm-auto-engine:最高精度,需 GPU
  • language:109 种语言 OCR 支持,默认自动检测
  • 页面范围:支持 start_page/end_page 分页处理,缓解内存压力

显著优点

1. 结构还原能力强:专为学术论文和技术文档优化,公式识别和表格提取效果优于通用 OCR 工具
2. 本地部署:数据不出本地,满足隐私合规要求

3. 多格式输出:Markdown 适合人阅读,JSON 适合机器处理

4. 多语言支持:覆盖 109 种语言,包括中英文混排场景

5. 开源可控:基于 MinerU 开源项目,可审计、可定制

潜在缺点与局限性

1. 硬件门槛高:推荐 32GB+ 内存,VLM 后端需 NVIDIA GPU 或 Apple Silicon
2. 安装复杂:依赖 Python 3.10-3.13,Windows 受限(不支持 3.13),依赖冲突常见

3. 处理速度:大文档或扫描件解析较慢,CPU 环境下性能明显下降

4. 路径限制:强制要求绝对路径,增加调用复杂度

5. 错误恢复:安装失败、内存不足等问题需要手动排查后端配置

适合人群

  • 科研人员:批量提取论文公式、表格、图表
  • 知识库工程师:构建可检索的结构化文档库
  • 技术写作者:将 PDF 技术文档转为 Markdown 维护
  • 企业合规团队:需在本地处理敏感文档的场景

常规风险

1. 资源耗尽风险:未分页处理大 PDF 可能导致内存溢出或系统卡顿
2. OCR 误识别:复杂排版、手写体、低质量扫描件识别率下降

3. 依赖维护:MinerU 版本更新可能引入 API 变更,需持续跟进

4. GPU 依赖陷阱:vlm-auto-engine 在无 GPU 环境直接报错,需提前确认硬件

安全与来源评估

  • 来源可信度 T2:MinerU 为 OpenDataLab 开源项目,GitHub 社区活跃,文档完善,属知名学术数据处理机构背书
  • 安全等级 A:纯本地执行,无网络传输;但需警惕 PDF 本身可能携带的恶意载荷(如通过图像解析触发的漏洞),建议沙箱环境预处理

pdf-parser-mineru 内容

script文件夹
手动下载zip · 10.1 kB
pdf_parser.pytext/plain
请选择文件