china-doc-ocr

📄 智能文档识别 · 发票证件一键提取

基于硅基流动 DeepSeek-OCR 和 PaddleOCR-VL 的多模态文档识别技能,支持 PDF、发票、证件、表格等复杂场景的智能提取,国内直连无需翻墙。

收藏
5.6k
安装
1.9k
版本
1.2.0
CLS 安全性认证2026-08-04
点击查看完整报告 >

使用说明

核心用法

china-doc-ocr 是一款面向中文场景的智能文档 OCR 识别技能,整合了硅基流动(SiliconFlow)平台的 DeepSeek-OCR、PaddleOCR-VL-1.5 以及 Qwen2.5-VL-72B 三大视觉模型,实现复杂文档的精准识别与结构化提取。

多格式支持:覆盖 PDF、JPEG/PNG/WebP/BMP/TIFF/GIF 等图片格式,支持本地文件、URL 链接及 Base64 编码输入。针对多页 PDF 提供分页处理方案,自动合并识别结果。

场景化识别模式

  • 通用 OCR:基础文字提取
  • 文档转 Markdown:保留标题层级、列表、表格、代码块等排版结构
  • 发票/证件识别:输出结构化字段(发票号码、金额、税号、日期等)
  • 表格解析:同时生成 Markdown 表格与 CSV 格式
  • 图表理解:解析柱状图、饼图等可视化数据

模型降级策略:优先使用免费快速的 PaddleOCR-VL-1.5,效果不佳时自动降级至 DeepSeek-OCR,必要时启用 Qwen2.5-VL-72B 作为兜底方案。

显著优点

1. 国内直连零门槛:依托硅基流动平台,无需 VPN 或海外 API 配置,注册即用
2. 成本友好:PaddleOCR-VL-1.5 和 DeepSeek-OCR 均提供免费额度,大幅降低使用成本

3. 中文场景优化:针对中文发票、营业执照、身份证等本土文档类型专项调优

4. 格式保留能力强:Markdown 转换模式完整还原原文档的层级结构与排版样式

5. 灵活的输入方式:支持文件路径、网络 URL、Base64 字符串三种输入形态

潜在缺点与局限性

  • 多页 PDF 依赖外部工具:需手动安装 pypdf 库进行分页处理,非开箱即用
  • 图片尺寸限制:最小 56×56、最大 3584×3584 像素,超大文档需预处理压缩
  • 隐私数据风险:发票、证件等敏感文件在处理后会留存工作区临时文件,需手动清理
  • 模型效果波动:Qwen2.5-VL 作为兜底方案时 OCR 准确率明显低于专业 OCR 模型
  • 速率限制:API 存在 429 频率限制,大批量文档处理需控制并发

适合人群

  • 财务人员:批量处理电子发票、报销单据
  • 行政/法务人员:合同扫描件转可编辑文本
  • 研究人员:学术论文 PDF 提取与笔记整理
  • 数据录入员:表格数据自动化采集
  • 开发者:集成文档识别能力至内部工作流

常规风险

数据安全风险:敏感证件、发票信息上传至第三方云服务商,存在合规隐患;建议处理完成后立即清理工作区文件。

API 稳定性风险:免费服务存在额度耗尽、服务调整或网络波动可能,关键业务建议配置备用方案。

识别准确性风险:手写体、印章遮挡、低分辨率扫描件可能导致识别错误,财务等关键场景需人工复核。

授权合规风险:处理含个人隐私或商业机密的第三方文档时,需确保具备合法授权。

安全解读

核心用法

China Doc OCR 是一款专为国内用户设计的智能文档识别技能,支持 PDF、图片、扫描件、发票、表格、证件等多种文档类型的 OCR 识别与结构化提取。该技能采用三层模型降级策略:默认使用 PaddleOCR-VL-1.5(免费、快速、专业),识别效果不佳时自动降级至 DeepSeek-OCR,必要时再降级至 Qwen2.5-VL-72B。用户可通过文件路径、URL 或 base64 编码直接输入文档,支持通用 OCR、文档转 Markdown、发票识别、证件识别、表格解析等多种处理模式。

显著优点

国内直连优势:基于 SiliconFlow 平台,无需翻墙即可使用 DeepSeek-OCR 等先进模型,大幅降低网络门槛。零依赖轻量设计:纯 Python 标准库实现,无第三方依赖包,彻底规避供应链攻击风险。模型智能降级:三层模型策略确保在不同场景下都能获得最优识别效果,兼顾成本与质量。多场景覆盖:从简单的文字提取到复杂的发票结构化识别、表格 CSV 导出、Markdown 格式保留,满足多样化需求。安全编码规范:无危险函数、无硬编码密钥、文件操作无路径遍历漏洞,代码结构清晰可审计。

潜在缺点与局限性

第三方数据外泄风险:所有文档内容需经 base64 编码后上传至 SiliconFlow 云端处理,敏感文件存在离开本地环境的风险。多页 PDF 处理繁琐:需依赖用户手动安装 pypdf 并分页处理,非开箱即用。API 配额依赖:功能完全依赖 SiliconFlow 服务可用性和用户 API 配额,存在服务中断或配额耗尽风险。社区维护水平:T3 来源可信度的个人/社区项目,无可用的 GitHub 仓库历史数据支撑长期信誉评估。图片质量敏感:最低 56×56、最高 3584×3584 像素限制,分辨率过低或过高的图片需预处理。

适合的目标群体

  • 需要频繁处理发票、合同、证件等文档的财务人员、行政人员
  • 希望将纸质资料数字化的研究者、学生、知识工作者
  • 需要批量提取表格数据的数据分析师、运营人员
  • 寻求无需翻墙的国产 OCR 替代方案的国内企业用户
  • 对供应链安全敏感、偏好无依赖实现的技术谨慎型用户

使用风险

隐私合规风险:文档上传至第三方云服务,不适合处理机密合同、个人隐私证件等敏感内容,建议处理后及时清理工作区临时文件。成本风险:OCR 服务按 token 计费,detail=high 时按实际像素计费,大文件或批量处理可能产生较高费用,需监控配额使用。可用性风险:完全依赖 SiliconFlow 服务,若服务故障或 API 变更将导致技能失效。误识别风险:复杂排版、手写体、低质量扫描件可能出现识别错误,关键数据需人工复核。

china-doc-ocr 内容

references文件夹
scripts文件夹
手动下载zip · 9.0 kB
models.mdtext/markdown
请选择文件