PDF to Markdown - Extract Text, Tables, Formulas from PDF

📄 零密钥 PDF 转 Markdown 神器

基于 MinerU 开源引擎的 PDF 转 Markdown 工具,支持文本、表格、公式提取,无需 API 密钥即可快速转换本地或在线 PDF 文档

收藏
2k
安装
987
版本
1.0.3
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

pdf2md 是一款基于 MinerU 开源项目的 PDF 转 Markdown 工具,通过 CLI 命令 mineru-open-api flash-extract 实现文档转换。支持本地 PDF 文件路径或 HTTP(S) URL 直接处理,无需预先下载。基础用法包括单文件转换、指定输出目录 -o、页面范围筛选 --pages,以及语言提示 --language(默认中文 ch,英文文档建议指定 en)。

显著优点

1. 零门槛使用:无需注册、API 密钥或任何身份验证,即装即用
2. 格式还原能力强:原生支持学术论文常见的复杂排版,对表格、LaTeX 公式提取效果优于普通 OCR 方案

3. 双模式架构flash-extract 满足日常快速需求;extract 模式(需认证)支持 200MB/600 页大文件及完整资源提取

4. 开源可信:Apache-2.0 协议,由上海人工智能实验室 OpenDataLab 维护,代码可审计

5. 跨平台支持:npm/Go 双渠道安装,macOS/Linux 额外支持 Homebrew

潜在缺点与局限性

  • 文件规格限制:免费模式单文件上限 10MB/20 页,超出需切换付费认证模式
  • 输出完整性flash-extract 对图片、复杂表格可能输出占位符而非原始资源
  • 网络依赖:所有处理通过 mineru.net API 完成,无法离线使用,存在服务可用性风险
  • 隐私考量:文档内容需上传至第三方服务器处理,敏感材料需谨慎评估
  • 语言识别:自动语言检测并非 100% 准确,复杂混排文档建议显式指定 --language

适合人群

  • 学术研究者:快速提取论文、报告中的可编辑文本与公式
  • 知识管理用户:将 PDF 资料转换为 Markdown 导入 Obsidian/Notion 等工具
  • 开发者/自动化工作流:无需维护 OCR 基础设施,通过 CLI 集成到数据处理管道

常规风险

| 风险类型 | 说明 |
|---------|------|
| 数据外传 | 文档内容发送至远端 API,存在传输及服务器侧残留风险 |
| 服务中断 | 依赖 mineru.net 可用性,无 SLA 保障 |
| 解析误差 | 扫描版 PDF、手写内容、极端复杂排版可能识别失败 |
| 输出占位 | 图片/表格可能被替换为 `[image]`、`[table]` 等标记而非实际内容 |

PDF to Markdown - Extract Text, Tables, Formulas from PDF 内容

手动下载zip · 1.5 kB
SKILL.mdtext/markdown
请选择文件