核心用法
china-doc-ocr 是一款面向中文场景的智能文档 OCR 识别技能,整合了硅基流动(SiliconFlow)平台的 DeepSeek-OCR、PaddleOCR-VL-1.5 以及 Qwen2.5-VL-72B 三大视觉模型,实现复杂文档的精准识别与结构化提取。
多格式支持:覆盖 PDF、JPEG/PNG/WebP/BMP/TIFF/GIF 等图片格式,支持本地文件、URL 链接及 Base64 编码输入。针对多页 PDF 提供分页处理方案,自动合并识别结果。
场景化识别模式:
- 通用 OCR:基础文字提取
- 文档转 Markdown:保留标题层级、列表、表格、代码块等排版结构
- 发票/证件识别:输出结构化字段(发票号码、金额、税号、日期等)
- 表格解析:同时生成 Markdown 表格与 CSV 格式
- 图表理解:解析柱状图、饼图等可视化数据
模型降级策略:优先使用免费快速的 PaddleOCR-VL-1.5,效果不佳时自动降级至 DeepSeek-OCR,必要时启用 Qwen2.5-VL-72B 作为兜底方案。
显著优点
1. 国内直连零门槛:依托硅基流动平台,无需 VPN 或海外 API 配置,注册即用
2. 成本友好:PaddleOCR-VL-1.5 和 DeepSeek-OCR 均提供免费额度,大幅降低使用成本
3. 中文场景优化:针对中文发票、营业执照、身份证等本土文档类型专项调优
4. 格式保留能力强:Markdown 转换模式完整还原原文档的层级结构与排版样式
5. 灵活的输入方式:支持文件路径、网络 URL、Base64 字符串三种输入形态
潜在缺点与局限性
- 多页 PDF 依赖外部工具:需手动安装
pypdf库进行分页处理,非开箱即用 - 图片尺寸限制:最小 56×56、最大 3584×3584 像素,超大文档需预处理压缩
- 隐私数据风险:发票、证件等敏感文件在处理后会留存工作区临时文件,需手动清理
- 模型效果波动:Qwen2.5-VL 作为兜底方案时 OCR 准确率明显低于专业 OCR 模型
- 速率限制:API 存在 429 频率限制,大批量文档处理需控制并发
适合人群
- 财务人员:批量处理电子发票、报销单据
- 行政/法务人员:合同扫描件转可编辑文本
- 研究人员:学术论文 PDF 提取与笔记整理
- 数据录入员:表格数据自动化采集
- 开发者:集成文档识别能力至内部工作流
常规风险
数据安全风险:敏感证件、发票信息上传至第三方云服务商,存在合规隐患;建议处理完成后立即清理工作区文件。
API 稳定性风险:免费服务存在额度耗尽、服务调整或网络波动可能,关键业务建议配置备用方案。
识别准确性风险:手写体、印章遮挡、低分辨率扫描件可能导致识别错误,财务等关键场景需人工复核。
授权合规风险:处理含个人隐私或商业机密的第三方文档时,需确保具备合法授权。