核心用法
pdf2md 是一个纯文档型 Skill,通过调用 MinerU 官方 CLI 工具 mineru-open-api 实现 PDF 到 Markdown 的转换。用户只需安装 CLI 工具后,使用 mineru-open-api flash-extract 命令即可处理本地 PDF 文件或网络 URL,支持页码范围选择(--pages 1-10)、语言提示(--language en/ch)及自定义输出目录(-o ./output/)。无需注册账号、无需 API 密钥,真正实现开箱即用。
显著优点
零门槛体验:无需 API 密钥、无需注册登录,大幅降低使用门槛,适合快速原型验证和临时文档处理场景。
权威技术底座:底层依赖 MinerU 引擎由 OpenDataLab(上海人工智能实验室)开源维护,在 PDF 结构解析、学术公式识别、复杂表格还原等场景具备业界领先能力。
多格式兼容:支持本地文件路径与网络 URL 双模式输入,自动识别文本、表格、数学公式等多元素,输出干净的标准 Markdown。
灵活可控:提供页码范围截取、语言提示等精细化参数,便于针对大文档进行局部处理或优化识别准确率。
潜在缺点与局限性
文件尺寸限制:免费模式单次仅支持 10MB / 20 页以内文档,大文件或整本电子书需改用付费 extract 模式并配置认证。
内容损耗风险:输出为纯 Markdown,图片、复杂表格、公式可能被替换为占位符或简化表示,不适合对排版精度要求极高的场景。
网络依赖:PDF 内容需上传至 MinerU 云端服务器处理,离线环境无法使用,且存在数据出境/隐私合规顾虑。
无自执行能力:Skill 本身仅为使用文档,实际功能完全依赖外部 CLI 工具,若环境配置不当(Node/Go/uv 未安装)则无法运行。
适合的目标群体
- 科研人员:快速提取学术论文、技术报告中的文本与公式,用于文献综述或笔记整理。
- 内容运营者:将 PDF 白皮书、产品手册转换为可编辑 Markdown,便于二次发布至博客或知识库。
- 开发者/学生:需要批量处理 PDF 文档进行数据分析、知识库构建或 RAG 应用开发。
- 效率工具爱好者:追求零配置、免注册的工具体验,用于日常临时文档转换需求。
使用风险
数据隐私:PDF 内容上传至第三方服务器(mineru.net),敏感文档(合同、病历、内部报告)存在泄露风险,建议优先使用本地部署方案。
外部依赖:CLI 工具版本更新可能导致命令行参数变更,需关注 MinerU 官方 changelog;npm/uv/go 任一安装源故障将影响 Skill 可用性。
服务稳定性:免费接口无 SLA 保障,高峰期可能出现限流或响应延迟,关键业务场景建议评估付费版本或备选方案。
识别准确率:扫描版 PDF、复杂版式设计或低质量图像可能导致解析错误,需人工校验关键内容。