核心用法
本技能封装了曙光 Scnet 通用 OCR 服务,通过 Python 脚本调用官方 API 实现图片文字提取。用户配置 SCNET_API_KEY 和可选的 SCNET_API_BASE 环境变量后,可通过命令行或 AI 对话触发识别。
调用方式:
- 命令行:
python .claude/skills/sugon-scnet-ocr/scripts/main.py GENERAL /path/to/image.jpg - AI 对话:直接说"OCR 这个图片里的文字,图片在 /path/to/image.png"
输入参数:
ocrType:识别类型,当前仅支持GENERAL(通用文字识别)filePath:本地图片绝对路径,支持 jpg、png、pdf 等格式
输出结构:JSON 格式,识别结果位于 data[0].result[0].elements 中,包含文字内容、坐标位置及置信度。
---
显著优点
1. 国产算力底座:依托曙光 Scnet 平台,底层为国产加速芯片,适合对自主可控有要求的政企场景
2. 即插即用设计:单一接口封装,无需关心模型部署,配置 Token 即可调用
3. 坐标级输出:返回文字框坐标(vertices),便于后续版面分析或结构化提取
4. AI 原生集成:支持通过自然语言描述自动触发,降低使用门槛
---
潜在缺点与局限性
| 维度 | 说明 |
|------|------|
| **功能覆盖** | 仅支持 `GENERAL` 通用识别,无表格、发票、身份证等垂直场景专用模型 |
| **速率限制** | 硬性 10 QPS 限制,高频批量处理需自行串行化或申请提额 |
| **网络依赖** | 纯云端 API,无法离线使用,受限于 Scnet 服务可用性 |
| **成本不透明** | 文档未提及计费模式,Token 可能涉及用量配额或付费 |
| **生态封闭** | 与 Scnet 平台深度绑定,迁移至其他 OCR 服务需重写适配层 |
| **安全合规** | API Key 需手动配置到本地 `.env`,存在误提交至版本控制的风险 |
---
适合人群
- 个人开发者:快速搭建 OCR 能力,无需自训模型
- 中小企业:文档数字化、档案录入等低频场景
- 国产化替代场景:需规避海外云服务商的政务、金融、能源行业
- AI Agent 构建者:需要将 OCR 作为工具链一环的自动化工作流
---
常规风险
| 风险类型 | 具体表现 | 缓解建议 |
|----------|----------|----------|
| **密钥泄露** | `SCNET_API_KEY` 若写入代码或日志,可能被恶意利用 | 使用 `config/.env` 隔离,设置 600 权限,禁止硬编码 |
| **数据出境** | 图片上传至 Scnet 云端处理,敏感文件存在合规隐患 | 确认 Scnet 数据中心位置及数据处理协议(DPA) |
| **服务中断** | 401/403/429 等错误导致流程中断 | 实现指数退避重试,关键业务准备降级方案 |
| **识别误差** | 手写体、复杂版式、低质量扫描件识别率下降 | 人工抽检 + 置信度阈值过滤 |
| **供应商锁定** | 深度依赖 Scnet API 格式,迁移成本高 | 抽象 OCR 接口层,预留多供应商适配能力 |