核心用法
GLM-OCR 是智谱 AI 推出的云端文档理解 SDK,通过 pip install glmocr 安装后即可调用。核心入口为 glmocr.parse() 函数或 GlmOcr 类,支持图像(JPG/PNG/WEBP 等)与 PDF 文件,返回包含 Markdown 正文、结构化 JSON 区域、边界框坐标的 PipelineResult 对象。
关键特性
- 云端 MaaS 模式:无需本地 GPU,调用智谱云 API,环境变量
ZHIPU_API_KEY即可生效 - CLI 零配置:支持
glmocr parse image.png --stdout直接输出结果,适合 Agent 工具链集成 - 结构化输出:自动识别标题、正文、表格、公式、图注、页眉页脚等 10 类区域,表格直接输出 Markdown 格式
- 灵活配置:Constructor 参数 > 环境变量 > .env 文件 > YAML 配置,Agent 可通过代码完全控制
显著优点
1. 零基础设施成本:纯云端推理,无需维护 OCR 模型或 GPU 服务器
2. 复杂版面解析:内置版面分析(Layout Detection),对学术论文、发票、财报等多栏混排文档效果稳定
3. Agent 友好:CLI 支持 --stdout --json-only --no-save 模式,结果可直接管道传输给下游工具(如 jq 过滤表格)
4. 批量处理:原生支持目录遍历与进度日志,适合文档数字化流水线
潜在局限
- 网络依赖:必须保持与智谱 API 的连通,离线环境无法使用
- 隐私敏感场景:文档内容需上传至第三方云端,金融、医疗等敏感领域需评估合规性
- 成本敏感:按量计费模式,高频大批量调用需关注 API 费用
- 不支持实时流:明确排除摄像头实时流、音频转写、非文档类图像(艺术插画等)
适合人群
- 需快速搭建文档数字化流程的开发者与自动化团队
- AI Agent 构建者,需要可靠的文档解析工具节点
- 无 GPU 资源或不愿维护本地 OCR 基础设施的中小团队
常规风险
- API 密钥泄露:
ZHIPU_API_KEY需妥善保管,避免硬编码提交至版本控制 - 超时与重试:大文档默认 600s 超时可能不足,需按需调整
- 错误处理:SDK 在 MaaS 错误时不抛出异常,需显式检查
result.to_dict().get("error") - 数据残留:虽输出目录可配置,但临时文件处理需符合内部安全规范
技术规格
- 边界框归一化至 0–1000 坐标系
- 支持自托管 vLLM/SGLang 模式(需本地 GPU)作为云端备选
- Python 3.8+,纯 Python 依赖,无系统级二进制要求