核心用法
image2text_ocr 技能封装了中科曙光 Scnet 平台的通用 OCR 识别能力,通过简单的接口调用即可从图片中提取结构化文字信息。使用时需先在 Scnet 官网申请 API Token(格式为 sc-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx),并在 config/.env 文件中配置 SCNET_API_KEY 环境变量。
技能支持两种调用方式:命令行直接执行 Python 脚本,或在 AI 对话中通过自然语言触发(如"OCR 这个图片")。输入参数仅需 ocrType(目前仅支持 GENERAL 通用文字识别)和 filePath(本地图片绝对路径),输出为包含识别结果和置信度的标准 JSON 格式。
显著优点
1. 官方背书:由中科曙光(Sugon)旗下 Scnet 平台提供,属于国有背景的高性能计算服务商,API 稳定性有一定保障
2. 中文优化:针对中文文字识别场景训练,对横竖混排、坐标定位等中文文档特性支持较好
3. 部署简便:仅需 Python 3.6+ 和 requests 库,无复杂依赖,适合快速集成
4. 结构化输出:返回结果包含文字坐标、置信度等元数据,便于后续解析和处理
潜在缺点与局限性
1. 功能单一:当前仅支持 GENERAL 通用文字识别,无表格识别、公式识别、多语言识别等进阶能力
2. 速率限制严格:10 QPS 的并发限制对批量处理场景构成瓶颈,需手动串行化调用
3. Token 管理成本:需单独申请、定期更新 API Key,且存在过期失效风险(401/403 错误)
4. 网络依赖:服务部署于 Scnet 云端,离线环境不可用,且受网络质量影响
5. 安全合规要求:Token 需严格保管(建议 600 权限),误配置可能导致泄露
适合人群
- 个人开发者需要轻量级中文 OCR 能力
- 企业用户处理标准化中文文档(合同、票据、扫描件)
- 已有 Scnet 平台账号或中科曙光子公司的技术栈用户
- 对数据不出公有云有顾虑,但可接受国有云服务的敏感行业用户
常规风险
| 风险类型 | 说明 | 缓解措施 |
|---------|------|---------|
| Token 泄露 | API Key 硬编码或误粘贴到对话中 | 使用 `.env` 文件,设置 600 权限,禁止版本控制 |
| 服务不可用 | 网络故障或 Scnet 平台维护 | 实现本地降级方案,关键业务准备备选 OCR 服务 |
| 速率超限 | 突发流量触发 429 错误 | 技能内置 3 次重试,业务层实现指数退避 |
| 识别精度不足 | 模糊图片、艺术字体、手写体 | 预处理图片(去噪、二值化),对关键结果人工复核 |