Zerox

📄 AI 视觉驱动的智能文档转 Markdown

基于 GPT-4o Vision 的多格式文档 OCR 转 Markdown 工具,支持 PDF、Office 文档及图片的智能识别与结构化提取

收藏
4.9k
安装
1.6k
版本
0.1.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能

Zerox 是一款基于 GPT-4o Vision API 的文档转换工具,能够将 PDF、DOCX、PPTX、图片等多种格式转换为结构化 Markdown 文本。其最大特点是采用视觉模型进行内容识别,因此即使对于扫描版 PDF 或纯图像文档,也能实现高质量的 OCR 提取。

显著优点

1. 格式兼容性广:原生支持 PDF(含扫描件)、Word、PowerPoint 及常见图片格式
2. 智能结构化输出:利用 GPT-4o 的语义理解能力,输出带格式的 Markdown,保留文档层级结构

3. 双模式执行:提供前台快速转换(<30秒任务)和后台异步处理(大文件/复杂文档)两种模式

4. 进度可追踪:后台模式支持日志监控和系统通知,避免长时间等待

潜在局限

  • 依赖外部 API:必须配置 OpenAI 兼容的 API 密钥,存在网络延迟和调用成本
  • 隐私风险:文档内容需上传至第三方视觉模型处理,敏感数据需谨慎评估
  • 成本不可控:按 token 计费,大型扫描文档可能产生较高费用
  • 无本地离线能力:完全依赖云端模型,无法离线使用

适合人群

  • 需要批量提取扫描文档/图片文字内容的研究人员
  • 希望将旧版 PDF/图片资料转为可编辑 Markdown 的知识管理者
  • 对文档结构化要求高于纯 OCR 文本的开发者

常规风险

| 风险类型 | 说明 |
|---------|------|
| 数据泄露 | 文档内容经 API 传输,需确认服务商隐私政策 |
| API 费用 | 视觉模型 token 消耗较高,建议设置用量上限 |
| 密钥管理 | API 密钥需妥善保管,避免硬编码或泄露 |
| 转换准确性 | 复杂排版、手写体、低质量扫描件可能影响效果 |

使用建议

敏感文档建议先进行脱敏处理,或选用本地 OCR 方案替代;生产环境使用前建议小规模测试验证成本与效果。

Zerox 内容

scripts文件夹
手动下载zip · 5.6 kB
convert-bg.mjstext/javascript
请选择文件