GLM-OCR-Handwriting

✍️ 官方手写识别,秒转可编辑文本

智谱官方手写体识别 API,支持多语言混排、草书印刷混合内容,一键将手写笔记转为可编辑文本。

收藏
2.2k
安装
1.1k
版本
1.0.4
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

GLM-OCR Handwriting 是智谱 AI 官方提供的手写体识别技能,基于 layout_parsing API 实现。用户可通过命令行工具 glm_ocr_cli.py 对本地图片或远程 URL 进行 OCR,支持 --file 本地路径或 --file-url 网络图片两种输入方式,结果以 Markdown 格式返回,可选 --output 保存 JSON 文件。

显著优点

  • 官方背书:智谱开放平台直接提供,API 稳定性与持续更新有保障
  • 多场景适配:支持草书、印刷体混排,中英文混合,公式与批注识别
  • 安全设计:强制固定端点 open.bigmodel.cn,禁止自定义 URL,防止密钥泄露;环境变量隔离配置,可全局复用 ZHIPU_API_KEY
  • 输出规范:结构化 JSON 响应,含 textlayout_details 等字段,便于下游处理

潜在缺点与局限性

  • 依赖外部服务:必须联网调用智谱 API,离线场景不可用
  • 成本与配额:按量计费,高频使用需关注额度消耗;遇 429 限流需等待
  • 无本地备选:官方强制规定 API 失败时禁止任何 fallback 识别方式,用户体验完全依赖服务可用性
  • 调试门槛--include-raw 仅用于调试,日常输出经过封装,复杂版式细节可能丢失

适合人群

  • 需要将纸质手写笔记数字化的学生、研究人员、办公人员
  • 处理历史档案、手稿、表单的行业用户
  • 已使用智谱生态(GLM-4V、GLM-Image 等)的开发者,可复用同一 API Key

常规风险

  • 密钥管理ZHIPU_API_KEY 若泄露可能导致账户被恶意调用,建议通过 openclaw.json 配置而非硬编码
  • 数据出境:图片需上传至智谱服务器处理,敏感文档需评估合规性
  • 识别误差:极端潦草字迹、低分辨率扫描、复杂背景可能降低准确率,关键内容建议人工复核

GLM-OCR-Handwriting 内容

scripts文件夹
手动下载zip · 8.7 kB
glm_ocr_cli.pytext/plain
请选择文件