TencentCloud General OCR

🔍 智能OCR一键提取图片文字

腾讯云OCR广告文字识别技能,支持中英文、横竖排及多角度翻转场景,精准提取图片文字与位置坐标,适用于广告内容审核、文档数字化等场景。

收藏
4.8k
安装
1k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

tencentcloud-ocr-general 是调用腾讯云广告文字识别(AdvertiseOCR)接口的专用技能,专注于从各类图片中提取文字信息。支持两种输入方式:图片URL(推荐存储于腾讯云COS)和本地Base64编码文件/图片。调用时需配置腾讯云API密钥环境变量,通过 scripts/main.py 执行识别任务。

技能核心输出包含:文本行内容(DetectedText)、四顶点坐标(Polygon)、置信度评分(0-100)以及图片尺寸信息。特别适用于需要精确定位文字区域的场景,如广告合规检测、图片内容审核等。

显著优点

1. 多场景适应性:支持横排、竖排、倾斜文字识别,并兼容90°/180°/270°翻转场景,覆盖复杂版式
2. 高准确性:官方宣称具备较高召回率与准确率,针对广告类图片专项优化

3. 结构化输出:返回精确的文本框坐标(Polygon四顶点),便于后续版面分析与区域截取

4. 企业级稳定性:依托腾讯云基础设施,默认20次/秒接口限频,满足中等规模业务需求

5. 双语支持:原生支持中英文混合识别

潜在局限

  • 商业化计费:调用即计费,无免费额度,需关注账户余额与资源包状态
  • 格式限制:仅支持PNG/JPG/JPEG/BMP,WebP等现代格式需预处理转换
  • 分辨率门槛:建议600×800以上分辨率,小图/模糊图识别效果下降
  • 隐私合规:图片数据需上传至腾讯云服务,涉及敏感信息时需评估数据出境与存储合规性
  • SDK依赖:必须安装tencentcloud-sdk-python并维护API密钥,增加环境复杂度

适合人群

  • 广告内容审核平台开发者
  • 需要批量提取图片文字的企业用户
  • 电商/营销领域的自动化合规检测场景
  • 已有腾讯云账号及COS存储基础设施的技术团队

常规风险

| 风险类型 | 说明 |
|---------|------|
| 账号欠费 | ResourceUnavailable.InArrears / ResourcePackageRunOut 导致服务中断 |
| 密钥泄露 | API密钥硬编码或环境变量管理不善引发未授权调用 |
| 数据隐私 | 敏感图片上传至第三方云服务,需签署DPA并确认数据处理条款 |
| 成本失控 | 高并发场景下20次/秒限频可能触发限流,大量调用需预算规划 |
| 识别偏差 | 极端角度、艺术字体、低对比度场景可能出现漏检或误识 |

TencentCloud General OCR 内容

scripts文件夹
手动下载zip · 5.6 kB
main.pytext/plain
请选择文件