核心用法
通用文字识别(General Text Recognition OCR)是一款基于极速数据(JisuAPI)平台的图像文字提取技能,支持本地图片路径或 base64 编码图片作为输入,自动识别并返回图片中的文字内容。
主要功能特性
多语言支持:覆盖中英文(cnen,默认)及英语、法语、葡萄牙语、德语、意大利语、西班牙语、俄语、日语共 9 种语言类型,通过 type 参数切换。
灵活输入方式:
- 本地图片路径(
path/image/file):脚本自动读取并转为 base64,支持 JPG/PNG 格式,单张上限约 500KB - 直接传入 base64 编码(
pic):适用于前置流程已处理图片的场景
标准化输出:返回统一的 JSON 结构,result 数组按行输出识别到的文字内容;错误场景包装为结构化错误对象,便于程序处理。
显著优点
1. 集成便捷:仅需配置 JISU_API_KEY 环境变量即可调用,无需复杂模型部署
2. 响应快速:依托极速数据云端服务,识别延迟较低
3. 中文场景优化:针对中英文混合场景(如截图、文档照片)有较好表现
4. 成本可控:提供免费额度及阶梯套餐,适合个人开发者到企业级使用
潜在缺点与局限性
- 图片大小限制:单张图片约 500KB 上限,高分辨率原图需压缩
- 网络依赖:纯云端方案,离线环境不可用
- 精度边界:复杂排版(表格、手写体、艺术字体、低对比度)识别率可能下降
- 隐私顾虑:图片需上传至第三方服务商处理,敏感文档需谨慎评估
- 语言覆盖有限:小众语种或方言不支持
适合人群
- 需要快速提取截图、照片文字的个人用户
- 开发文档数字化、发票/名片识别等功能的开发者
- 内容创作者进行二手资料转录、笔记整理
- 轻度 OCR 需求场景,无需自建深度学习基础设施
常规风险
| 风险类型 | 说明 |
|---------|------|
| 数据隐私 | 图片上传至极速数据服务器,含敏感信息需脱敏或评估合规性 |
| API 稳定性 | 依赖第三方服务可用性,建议实现重试与降级机制 |
| 密钥安全 | `JISU_API_KEY` 需妥善保管,避免硬编码提交至版本控制 |
| 识别误差 | 重要场景需人工复核,避免完全依赖自动识别结果 |