GLM-OCR-Handwriting

📝 智能手写识别,一键转可编辑文本

基于智谱 GLM-OCR API 的手写体识别技能,支持中英文混排、手写印刷混合内容提取,需配置 ZHIPU_API_KEY 使用。

收藏
4.8k
安装
1.1k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

GLM-V Handwriting Recognition 是一款调用智谱 AI GLM-OCR 版面解析 API 的手写体识别技能,通过命令行脚本将手写笔记、信件、文档中的文字提取为可编辑文本。使用时需配置 ZHIPU_API_KEY 环境变量,支持本地文件路径(--file)或远程 URL(--file-url)两种输入方式,结果以 JSON 格式返回,包含 Markdown 格式的提取文本、版面分析详情及原始 API 响应。

主要特性

  • 多风格识别:支持草书、印刷体等多种手写风格
  • 多语言支持:覆盖中文、英文及中英混排内容
  • 混合内容处理:可同时识别手写与印刷文字混排的文档
  • 灵活输入:支持本地图片/PDF 及远程 URL

输出规范

技能强制要求完整展示 API 返回的原始 OCR 结果,不得概括或省略,以便用户自行评估识别质量。结果可保存为 JSON 文件(--output),支持格式化打印(--pretty)。

显著优点

1. 专业级 OCR 能力:依托智谱 GLM 大模型,手写识别准确率显著高于传统 OCR 方案
2. 零本地计算依赖:纯云端推理,无需本地 GPU 或复杂依赖安装

3. 统一密钥管理:与智谱生态其他技能(如 glmocrglmv-caption)共享同一 API Key

4. 结构化输出:返回 Markdown 格式文本及详细的版面布局信息,便于后续处理

潜在局限与风险

  • API 依赖性强:必须联网使用,服务可用性受智谱平台影响
  • 成本门槛:按调用量计费,高频使用需关注配额消耗
  • 隐私合规:手写文档上传至第三方云端,敏感内容存在数据出境风险
  • 强制限制严格:API 失败时禁止任何 fallback 方案,用户体验可能中断
  • 密钥泄露风险ZHIPU_API_KEY 需妥善保管,硬编码或日志泄露可能导致未授权消费

适合人群

  • 需要将纸质手写笔记数字化归档的学生、研究人员
  • 处理手写病历、表格、批注的行政及医疗工作者
  • 开发文档数字化工作流的技术人员
  • 对中文手写识别有较高准确率要求的用户

常规风险提示

| 风险类型 | 说明 |
|---------|------|
| 数据隐私 | 手写内容上传至智谱服务器,涉及个人信息需评估合规性 |
| 服务稳定性 | 依赖单一云服务商,存在 429 限流、5xx 故障等中断可能 |
| 成本失控 | 未设置用量上限时,异常调用可能导致超额消费 |
| 识别误差 | 潦草字迹、低质量扫描件仍可能存在误识别 |

GLM-OCR-Handwriting 内容

scripts文件夹
手动下载zip · 6.8 kB
glm_ocr_cli.pytext/plain
请选择文件