Image2text Ocr

📄 曙光 Scnet 官方 OCR 文字识别

中科曙光 Scnet 官方 OCR 服务,支持通用文字识别,需申请 API Token 使用,10 QPS 速率限制,适合中文文档数字化场景。

收藏
2.5k
安装
958
版本
1.0.2
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

image2text_ocr 技能封装了中科曙光 Scnet 平台的通用 OCR 识别能力,通过简单的接口调用即可从图片中提取结构化文字信息。使用时需先在 Scnet 官网申请 API Token(格式为 sc-xxxxxxxxxxxxxxxxxxxxxxxxxxxxxxxx),并在 config/.env 文件中配置 SCNET_API_KEY 环境变量。

技能支持两种调用方式:命令行直接执行 Python 脚本,或在 AI 对话中通过自然语言触发(如"OCR 这个图片")。输入参数仅需 ocrType(目前仅支持 GENERAL 通用文字识别)和 filePath(本地图片绝对路径),输出为包含识别结果和置信度的标准 JSON 格式。

显著优点

1. 官方背书:由中科曙光(Sugon)旗下 Scnet 平台提供,属于国有背景的高性能计算服务商,API 稳定性有一定保障
2. 中文优化:针对中文文字识别场景训练,对横竖混排、坐标定位等中文文档特性支持较好

3. 部署简便:仅需 Python 3.6+ 和 requests 库,无复杂依赖,适合快速集成

4. 结构化输出:返回结果包含文字坐标、置信度等元数据,便于后续解析和处理

潜在缺点与局限性

1. 功能单一:当前仅支持 GENERAL 通用文字识别,无表格识别、公式识别、多语言识别等进阶能力
2. 速率限制严格:10 QPS 的并发限制对批量处理场景构成瓶颈,需手动串行化调用

3. Token 管理成本:需单独申请、定期更新 API Key,且存在过期失效风险(401/403 错误)

4. 网络依赖:服务部署于 Scnet 云端,离线环境不可用,且受网络质量影响

5. 安全合规要求:Token 需严格保管(建议 600 权限),误配置可能导致泄露

适合人群

  • 个人开发者需要轻量级中文 OCR 能力
  • 企业用户处理标准化中文文档(合同、票据、扫描件)
  • 已有 Scnet 平台账号或中科曙光子公司的技术栈用户
  • 对数据不出公有云有顾虑,但可接受国有云服务的敏感行业用户

常规风险

| 风险类型 | 说明 | 缓解措施 |
|---------|------|---------|
| Token 泄露 | API Key 硬编码或误粘贴到对话中 | 使用 `.env` 文件,设置 600 权限,禁止版本控制 |
| 服务不可用 | 网络故障或 Scnet 平台维护 | 实现本地降级方案,关键业务准备备选 OCR 服务 |
| 速率超限 | 突发流量触发 429 错误 | 技能内置 3 次重试,业务层实现指数退避 |
| 识别精度不足 | 模糊图片、艺术字体、手写体 | 预处理图片(去噪、二值化),对关键结果人工复核 |

Image2text Ocr 内容

assets文件夹
templates文件夹
references文件夹
scripts文件夹
手动下载zip · 11.4 kB
fields-summary.mdtext/markdown
请选择文件