核心功能
本技能封装了 MinerU 开源 PDF 解析引擎,提供两个核心工具:pdf_to_markdown 与 pdf_to_json。前者将 PDF 转换为保留结构、公式、表格和图片的 Markdown 文档;后者输出包含完整布局元数据的 JSON 格式,便于下游程序化处理。两者均支持分页解析、多语言 OCR(109 种语言)、公式识别与表格提取。
显著优点
1. 多后端适配:提供 hybrid-auto-engine(平衡模式,默认)、pipeline(纯 CPU)、vlm-auto-engine(高精度 GPU)三种后端,兼顾不同硬件环境。
2. 复杂版式还原:针对学术论文场景优化,对双栏布局、浮动公式、跨页表格的解析能力优于传统 PDF 转文本工具。
3. 本地私有化部署:数据无需上传云端,适合处理敏感文档。
4. 开源生态:基于 MIT 许可的 MinerU 项目,社区活跃,更新迭代快。
潜在局限
- 硬件门槛较高:推荐 32GB+ 内存与 NVIDIA GPU(Volta+),纯 CPU 模式速度显著下降。
- 依赖复杂:需 Python 3.10-3.13、uv 包管理器及大量深度学习依赖,安装过程可能出现版本冲突。
- 页码零基计数:接口设计采用 0 起始页码,易造成使用混淆。
- 扫描 PDF 质量敏感:OCR 准确率受扫描分辨率与字体清晰度影响,复杂手写体或低质量扫描件识别效果有限。
适合人群
- 科研人员与研究生:批量提取论文公式、表格与参考文献。
- 技术写作者:将 PDF 技术文档转换为 Markdown 维护。
- 数据工程师:构建本地文档解析流水线,替代云端 API。
- 隐私敏感型企业:需在本地完成合同、报告等敏感文件的结构化处理。
常规风险
- 内存溢出风险:未分页处理大型 PDF(数百页)可能导致系统内存耗尽。
- 路径注入风险:
file_path与output_dir参数未显示校验,需确保调用方传入可信绝对路径。 - 依赖供应链风险:MinerU 依赖 PyTorch、Transformers 等重型库,存在间接依赖漏洞可能。
- 模型偏见风险:OCR 与版面分析模型对非拉丁语系、特殊符号的训练数据覆盖可能不均。