核心用法
china-doc-ocr 是面向中国用户的智能文档OCR识别工具,专为处理复杂版式文档设计。核心能力包括:
- 多格式支持:PDF(含多页)、JPG/PNG/WebP等图片、扫描件、发票、身份证、营业执照、表格、图表
- 双模型驱动:DeepSeek-V3(文档理解+OCR)与 PaddleOCR-VL(版面分析)双保险
- 灵活输入:本地文件、URL直传、base64编码三种方式
- 结构化输出:Markdown保留格式、发票字段提取、表格CSV转换
显著优点
1. 国内网络零障碍:硅基流动(SiliconFlow)服务器部署,无需VPN或代理,API响应延迟低
2. 生态整合优势:与 china-image-gen、china-tts 共用 SILICONFLOW_API_KEY,降低多服务密钥管理成本
3. 复杂版面处理能力:相比传统OCR,能识别多栏排版、图文混排、嵌套表格等复杂布局
4. 多页PDF自动化:内置分页处理脚本,自动拆分识别并合并结果
5. Prompt模板化:针对不同场景(发票/证件/表格/文档)预置优化提示词
潜在局限与风险
- 模型依赖性强:完全依赖SiliconFlow服务可用性,若该服务中断则无法替代
- 隐私合规注意:发票、身份证等敏感信息需上传至第三方云服务,企业用户需评估数据出境合规
- 大文件处理瓶颈:>10MB文件需手动分页,超大PDF可能触发token上限
- 识别准确性波动:手写体、低分辨率扫描件、复杂艺术字体识别率可能下降
- 计费模式:detail=high按实际像素计费,高频调用成本需预估
适合人群
- 需要处理中文文档的国内开发者/办公人员
- 发票报销自动化、合同归档数字化场景
- 已使用SiliconFlow生态(图像生成/TTS)的存量用户
- 对网络稳定性要求高、无法使用海外OpenAI/Claude服务的团队
常规风险提示
- 密钥安全:
SILICONFLOW_API_KEY需妥善保管,避免硬编码提交至代码仓库 - 临时文件清理:工作区
$OPENCLAW_WORKSPACE/ocr_*目录可能残留敏感文档,建议定期清理 - 加密PDF预处理:需先用
qpdf --decrypt解密后再识别 - 结果校验建议:关键业务场景(如财务发票)建议人工复核识别结果