china-doc-ocr

📄 复杂文档一键转结构化文字

基于硅基流动DeepSeek-OCR的国产文档识别方案,支持PDF、图片、发票、表格等复杂版式提取,国内直连免翻墙,与图像生成、语音合成服务共用API密钥。

收藏
7.9k
安装
1.9k
版本
1.0.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

china-doc-ocr 是面向中国用户的智能文档OCR识别工具,专为处理复杂版式文档设计。核心能力包括:

  • 多格式支持:PDF(含多页)、JPG/PNG/WebP等图片、扫描件、发票、身份证、营业执照、表格、图表
  • 双模型驱动:DeepSeek-V3(文档理解+OCR)与 PaddleOCR-VL(版面分析)双保险
  • 灵活输入:本地文件、URL直传、base64编码三种方式
  • 结构化输出:Markdown保留格式、发票字段提取、表格CSV转换

显著优点

1. 国内网络零障碍:硅基流动(SiliconFlow)服务器部署,无需VPN或代理,API响应延迟低
2. 生态整合优势:与 china-image-genchina-tts 共用 SILICONFLOW_API_KEY,降低多服务密钥管理成本

3. 复杂版面处理能力:相比传统OCR,能识别多栏排版、图文混排、嵌套表格等复杂布局

4. 多页PDF自动化:内置分页处理脚本,自动拆分识别并合并结果

5. Prompt模板化:针对不同场景(发票/证件/表格/文档)预置优化提示词

潜在局限与风险

  • 模型依赖性强:完全依赖SiliconFlow服务可用性,若该服务中断则无法替代
  • 隐私合规注意:发票、身份证等敏感信息需上传至第三方云服务,企业用户需评估数据出境合规
  • 大文件处理瓶颈:>10MB文件需手动分页,超大PDF可能触发token上限
  • 识别准确性波动:手写体、低分辨率扫描件、复杂艺术字体识别率可能下降
  • 计费模式:detail=high按实际像素计费,高频调用成本需预估

适合人群

  • 需要处理中文文档的国内开发者/办公人员
  • 发票报销自动化、合同归档数字化场景
  • 已使用SiliconFlow生态(图像生成/TTS)的存量用户
  • 对网络稳定性要求高、无法使用海外OpenAI/Claude服务的团队

常规风险提示

  • 密钥安全SILICONFLOW_API_KEY 需妥善保管,避免硬编码提交至代码仓库
  • 临时文件清理:工作区 $OPENCLAW_WORKSPACE/ocr_* 目录可能残留敏感文档,建议定期清理
  • 加密PDF预处理:需先用 qpdf --decrypt 解密后再识别
  • 结果校验建议:关键业务场景(如财务发票)建议人工复核识别结果

china-doc-ocr 内容

references文件夹
手动下载zip · 7.8 kB
models.mdtext/markdown
请选择文件