ebook-to-md

📄 扫描文档一键转 Markdown

将扫描版PDF、图片及电子书格式转为结构化Markdown,集成百度OCR实现图像文字识别,支持中文场景文档数字化。

收藏
3.2k
安装
1k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能

ebook-to-md 是一款专注于文档数字化的工具技能,通过调用百度OCR服务,将非结构化或半结构化的文档内容转换为可编辑的Markdown格式。

核心用法:

  • 扫描PDF处理:针对图像型PDF进行OCR识别,提取文字并保留基础版式
  • 单图识别:支持PNG/JPEG格式图片的直接文字提取
  • 电子书转换:MOBI/EPUB格式需先经Calibre转为PDF,再进行OCR处理
  • 智能格式化:自动将短标题转为##二级标题,对话段落前插入空行,提升可读性

显著优点:

  • 中文OCR场景针对性强,百度OCR对中文识别效果较好
  • 输出格式干净,自动添加Markdown结构化标记
  • 支持base64图片内联,便于单文件归档
  • 命令行与Python API双接口,集成灵活

潜在局限:

  • 单一OCR引擎:仅支持百度OCR,无备选方案,若服务受限则完全失效
  • 依赖外部工具:MOBI/EPUB转换强制依赖Calibre,增加部署复杂度
  • 识别质量边界:复杂排版、手写体、低分辨率图像识别效果受限
  • 隐私考量:文档内容需上传至百度云服务,敏感资料存在合规风险

适合人群:

  • 需要批量处理扫描文档的学术研究者、档案管理员
  • 希望将电子书笔记转为可编辑Markdown的知识管理用户
  • 中文内容数字化需求优先于数据隐私敏感度的场景

常规风险:

  • API密钥管理不当可能导致百度云服务滥用
  • 大文件批量处理可能触发API限流或产生较高调用成本
  • OCR识别错误需人工校对,不适合作为唯一数据源

ebook-to-md 内容

fixtures文件夹
expected文件夹
scripts文件夹
手动下载zip · 17.5 kB
test_minimal.mdtext/markdown
请选择文件