核心用法
GLM-OCR Handwriting Recognition 是智谱 AI 官方提供的专用技能,基于 GLM-OCR 版面解析 API 实现手写文字识别。核心用法包括:
- 图像/PDF 识别:通过本地文件路径 (
--file) 或远程 URL (--file-url) 输入待识别内容 - 结果输出:支持直接打印或保存为 JSON 文件 (
--output),格式化输出 (--pretty) - 调试模式:可选包含原始上游响应 (
--include-raw) 用于问题排查
典型调用示例:
python scripts/glm_ocr_cli.py --file notes.png --output result.json --pretty
显著优点
1. 多风格兼容:支持草书、印刷体、混合手写印刷等多种书写风格
2. 多语言支持:中文、英文及中英混写手写的准确识别
3. 版面解析能力:不仅提取文字,还提供 layout_details 版面结构分析
4. 官方背书:智谱官方技能,API 稳定性与持续更新有保障
5. 安全设计:固定官方端点,禁止自定义 URL 覆盖,防止密钥泄露
潜在缺点与局限性
- 依赖外部 API:必须联网调用智谱云服务,无法离线使用
- 密钥成本:需智谱开放平台 API Key,存在调用费用(按量计费)
- 超时风险:大文件或复杂版面可能触发超时,需配置
GLM_OCR_TIMEOUT - 无本地备选:强制限制要求仅使用官方 API,失败时无替代方案
- 中文生态为主:虽然支持英文,但文档与优化以中文场景为核心
适合人群
- 需要将纸质笔记、手写文档数字化的学生、教师、研究人员
- 处理手写表单、合同批注的企业文员与法务人员
- 构建手写数据采集流程的开发者与 RPA 工程师
- 中文用户为主,兼顾英文手写需求的跨语言场景
常规风险
| 风险类型 | 说明 |
|---------|------|
| **密钥泄露** | 需妥善保管 `ZHIPU_API_KEY`,避免硬编码或提交至版本控制 |
| **数据传输** | 图片文件上传至智谱服务器,敏感文档需评估合规性 |
| **API 可用性** | 依赖智谱云服务稳定性,存在网络中断或服务降级风险 |
| **识别误差** | 极端潦草字迹、低分辨率图像可能导致识别失败或错误 |
| **成本失控** | 高频大批量调用可能产生意外费用,建议监控用量 |
该技能定位为专业级手写 OCR 工具,适合对识别质量要求高、能接受云服务依赖的用户场景。