Image2text Ocr

🔍 国产算力驱动的智能文字识别

基于 Sugon-Scnet 官方 API 的 OCR 文字识别技能,支持通用文字提取,需自备 API Key,有 10 QPS 速率限制,适合本地化文档数字化场景。

收藏
3.4k
安装
958
版本
1.0.3
CLS 安全性认证2026-08-05
点击查看完整报告 >

使用说明

核心用法

本技能封装了曙光 Scnet 通用 OCR 服务,通过 Python 脚本调用官方 API 实现图片文字提取。用户配置 SCNET_API_KEY 和可选的 SCNET_API_BASE 环境变量后,可通过命令行或 AI 对话触发识别。

调用方式

  • 命令行:python .claude/skills/sugon-scnet-ocr/scripts/main.py GENERAL /path/to/image.jpg
  • AI 对话:直接说"OCR 这个图片里的文字,图片在 /path/to/image.png"

输入参数

  • ocrType:识别类型,当前仅支持 GENERAL(通用文字识别)
  • filePath:本地图片绝对路径,支持 jpg、png、pdf 等格式

输出结构:JSON 格式,识别结果位于 data[0].result[0].elements 中,包含文字内容、坐标位置及置信度。

---

显著优点

1. 国产算力底座:依托曙光 Scnet 平台,底层为国产加速芯片,适合对自主可控有要求的政企场景
2. 即插即用设计:单一接口封装,无需关心模型部署,配置 Token 即可调用

3. 坐标级输出:返回文字框坐标(vertices),便于后续版面分析或结构化提取

4. AI 原生集成:支持通过自然语言描述自动触发,降低使用门槛

---

潜在缺点与局限性

| 维度 | 说明 |
|------|------|
| **功能覆盖** | 仅支持 `GENERAL` 通用识别,无表格、发票、身份证等垂直场景专用模型 |
| **速率限制** | 硬性 10 QPS 限制,高频批量处理需自行串行化或申请提额 |
| **网络依赖** | 纯云端 API,无法离线使用,受限于 Scnet 服务可用性 |
| **成本不透明** | 文档未提及计费模式,Token 可能涉及用量配额或付费 |
| **生态封闭** | 与 Scnet 平台深度绑定,迁移至其他 OCR 服务需重写适配层 |
| **安全合规** | API Key 需手动配置到本地 `.env`,存在误提交至版本控制的风险 |

---

适合人群

  • 个人开发者:快速搭建 OCR 能力,无需自训模型
  • 中小企业:文档数字化、档案录入等低频场景
  • 国产化替代场景:需规避海外云服务商的政务、金融、能源行业
  • AI Agent 构建者:需要将 OCR 作为工具链一环的自动化工作流

---

常规风险

| 风险类型 | 具体表现 | 缓解建议 |
|----------|----------|----------|
| **密钥泄露** | `SCNET_API_KEY` 若写入代码或日志,可能被恶意利用 | 使用 `config/.env` 隔离,设置 600 权限,禁止硬编码 |
| **数据出境** | 图片上传至 Scnet 云端处理,敏感文件存在合规隐患 | 确认 Scnet 数据中心位置及数据处理协议(DPA) |
| **服务中断** | 401/403/429 等错误导致流程中断 | 实现指数退避重试,关键业务准备降级方案 |
| **识别误差** | 手写体、复杂版式、低质量扫描件识别率下降 | 人工抽检 + 置信度阈值过滤 |
| **供应商锁定** | 深度依赖 Scnet API 格式,迁移成本高 | 抽象 OCR 接口层,预留多供应商适配能力 |

安全解读

核心用法

image2text_ocr 是一款封装了 Sugon-Scnet 通用 OCR 服务的技能,专为需要从图片中提取文字信息的场景设计。用户只需指定本地图片路径和识别类型(目前支持 GENERAL 通用文字识别),即可调用 SCNet 云端 OCR 能力完成文字提取。该技能支持 JPG、PNG、PDF 等常见格式,能够识别横竖版文字并返回带坐标的结构化结果。在 AI 对话中,用户可直接说"OCR 这个图片里的文字"并指定路径,AI 会自动触发本技能;也可通过命令行直接调用 Python 脚本执行。

显著优点

权威技术背书:由中科曙光旗下曙光网络(SCNet)提供底层 OCR 引擎,属于国产算力基础设施的延伸服务,技术可靠性和持续运维有保障。

使用门槛低:仅需配置 SCNET_API_KEY 环境变量即可使用,无需复杂的环境搭建;支持本地文件直接读取,与现有工作流无缝衔接。

输出结构化:返回 JSON 格式的识别结果,包含文字内容、置信度及坐标信息,便于下游程序自动处理和分析。

安全设计完善:代码包含合理的超时控制(60秒)、自动重试机制(最多3次)和速率限制保护(10 QPS),避免因网络波动或频繁调用导致服务异常。

潜在缺点与局限性

依赖外部服务:所有识别请求必须发送至 SCNet 云端 API,离线环境无法使用;网络质量直接影响响应速度和稳定性。

速率限制约束:当前 API 限制为 10 QPS,大规模批量处理需串行调用或申请提升限额,高频场景下可能成为瓶颈。

功能类型单一:当前版本仅支持 GENERAL 通用文字识别,缺少针对发票、表格、证件等场景的专项优化模式。

隐私敏感考量:图片内容需上传至第三方服务器处理,涉及敏感文档时需评估数据出境/出域合规风险。

适合的目标群体

  • 办公自动化用户:需要将扫描件、截图、照片等转为可编辑文本的职场人士
  • 开发者与数据工程师:构建文档数字化、档案管理、RPA 流程的技术人员
  • 科研人员:处理论文截图、实验记录图片等需要批量文字提取的研究者
  • 内容运营人员:快速提取社交媒体截图、竞品物料中的文案信息

常规使用风险

API 可用性风险:服务由 SCNet 运营,存在因服务商维护、网络故障或账户欠费导致的服务中断可能;建议关注官方状态公告。

数据隐私风险:图片上传至云端处理,敏感信息(如身份证、合同、内部文件)可能面临泄露或合规审查,建议评估后再使用。

Token 管理风险:API Key 需妥善保管,避免硬编码或误提交至代码仓库;过期后需及时更新,否则导致调用失败。

文件路径风险:技能读取用户指定的本地文件路径,需确保路径正确且文件可访问,避免因权限问题或文件不存在导致识别失败。

Image2text Ocr 内容

assets文件夹
templates文件夹
references文件夹
scripts文件夹
手动下载zip · 12.0 kB
fields-summary.mdtext/markdown
请选择文件