核心用法
pdf2md 是一款基于 MinerU 开源项目的 PDF 转 Markdown 工具,通过 CLI 命令 mineru-open-api flash-extract 实现文档转换。支持本地 PDF 文件路径或 HTTP(S) URL 直接处理,无需预先下载。基础用法包括单文件转换、指定输出目录 -o、页面范围筛选 --pages,以及语言提示 --language(默认中文 ch,英文文档建议指定 en)。
显著优点
1. 零门槛使用:无需注册、API 密钥或任何身份验证,即装即用
2. 格式还原能力强:原生支持学术论文常见的复杂排版,对表格、LaTeX 公式提取效果优于普通 OCR 方案
3. 双模式架构:flash-extract 满足日常快速需求;extract 模式(需认证)支持 200MB/600 页大文件及完整资源提取
4. 开源可信:Apache-2.0 协议,由上海人工智能实验室 OpenDataLab 维护,代码可审计
5. 跨平台支持:npm/Go 双渠道安装,macOS/Linux 额外支持 Homebrew
潜在缺点与局限性
- 文件规格限制:免费模式单文件上限 10MB/20 页,超出需切换付费认证模式
- 输出完整性:
flash-extract对图片、复杂表格可能输出占位符而非原始资源 - 网络依赖:所有处理通过 mineru.net API 完成,无法离线使用,存在服务可用性风险
- 隐私考量:文档内容需上传至第三方服务器处理,敏感材料需谨慎评估
- 语言识别:自动语言检测并非 100% 准确,复杂混排文档建议显式指定
--language
适合人群
- 学术研究者:快速提取论文、报告中的可编辑文本与公式
- 知识管理用户:将 PDF 资料转换为 Markdown 导入 Obsidian/Notion 等工具
- 开发者/自动化工作流:无需维护 OCR 基础设施,通过 CLI 集成到数据处理管道
常规风险
| 风险类型 | 说明 |
|---------|------|
| 数据外传 | 文档内容发送至远端 API,存在传输及服务器侧残留风险 |
| 服务中断 | 依赖 mineru.net 可用性,无 SLA 保障 |
| 解析误差 | 扫描版 PDF、手写内容、极端复杂排版可能识别失败 |
| 输出占位 | 图片/表格可能被替换为 `[image]`、`[table]` 等标记而非实际内容 |