GLM-OCR-SDK

📄 云端智能文档解析 SDK

调用智谱 GLM-OCR API 实现高精度文档解析,支持 PDF/图片/扫描件的文字、表格、公式提取,输出结构化 Markdown 与 JSON,无需 GPU、配置极简。

收藏
3.5k
安装
969
版本
1.0.2
CLS 安全性认证2026-08-03
点击查看完整报告 >

使用说明

核心用法

GLM-OCR 是智谱 AI 推出的云端文档理解 SDK,通过 pip install glmocr 安装后即可调用。核心入口为 glmocr.parse() 函数或 GlmOcr 类,支持图像(JPG/PNG/WEBP 等)与 PDF 文件,返回包含 Markdown 正文、结构化 JSON 区域、边界框坐标的 PipelineResult 对象。

关键特性

  • 云端 MaaS 模式:无需本地 GPU,调用智谱云 API,环境变量 ZHIPU_API_KEY 即可生效
  • CLI 零配置:支持 glmocr parse image.png --stdout 直接输出结果,适合 Agent 工具链集成
  • 结构化输出:自动识别标题、正文、表格、公式、图注、页眉页脚等 10 类区域,表格直接输出 Markdown 格式
  • 灵活配置:Constructor 参数 > 环境变量 > .env 文件 > YAML 配置,Agent 可通过代码完全控制

显著优点

1. 零基础设施成本:纯云端推理,无需维护 OCR 模型或 GPU 服务器
2. 复杂版面解析:内置版面分析(Layout Detection),对学术论文、发票、财报等多栏混排文档效果稳定

3. Agent 友好:CLI 支持 --stdout --json-only --no-save 模式,结果可直接管道传输给下游工具(如 jq 过滤表格)

4. 批量处理:原生支持目录遍历与进度日志,适合文档数字化流水线

潜在局限

  • 网络依赖:必须保持与智谱 API 的连通,离线环境无法使用
  • 隐私敏感场景:文档内容需上传至第三方云端,金融、医疗等敏感领域需评估合规性
  • 成本敏感:按量计费模式,高频大批量调用需关注 API 费用
  • 不支持实时流:明确排除摄像头实时流、音频转写、非文档类图像(艺术插画等)

适合人群

  • 需快速搭建文档数字化流程的开发者与自动化团队
  • AI Agent 构建者,需要可靠的文档解析工具节点
  • 无 GPU 资源或不愿维护本地 OCR 基础设施的中小团队

常规风险

  • API 密钥泄露ZHIPU_API_KEY 需妥善保管,避免硬编码提交至版本控制
  • 超时与重试:大文档默认 600s 超时可能不足,需按需调整
  • 错误处理:SDK 在 MaaS 错误时不抛出异常,需显式检查 result.to_dict().get("error")
  • 数据残留:虽输出目录可配置,但临时文件处理需符合内部安全规范

技术规格

  • 边界框归一化至 0–1000 坐标系
  • 支持自托管 vLLM/SGLang 模式(需本地 GPU)作为云端备选
  • Python 3.8+,纯 Python 依赖,无系统级二进制要求

安全解读

核心用法

GLM-OCR Skill 是智谱AI官方提供的纯文档型技能,用于指导Agent调用GLM-OCR SDK进行文档智能解析。用户只需配置ZHIPU_API_KEY环境变量,即可通过Python API或CLI命令行工具解析图片、PDF、扫描件等格式的文档,无需本地GPU算力支持。

典型调用流程:安装pip install glmocr → 配置API密钥 → 调用glmocr.parse("document.pdf") → 获取markdown_result(可读文本)和json_result(结构化区域数据)。CLI模式支持批量处理目录、管道输出到jq等工具链,非常适合Agent自动化场景。

显著优点

1. 零本地依赖:纯云端MaaS模式,无需配置CUDA、PyTorch等深度学习环境,降低部署门槛
2. 多格式支持:原生支持PDF、PNG、JPG、WebP、BMP、GIF等常见文档格式

3. 结构化输出:自动识别文本、标题、表格、公式、图片、页眉页脚等9类区域,附带归一化边界框坐标

4. 双格式交付:同时输出Markdown(便于LLM阅读)和JSON(便于程序解析)

5. 灵活配置:支持环境变量、.env文件、构造函数参数等多级配置,Agent可通过--api-key参数直接注入密钥

潜在缺点与局限性

  • 网络依赖:必须连接智谱AI云服务,离线环境无法使用
  • API成本:按调用量计费,大规模文档处理需考虑成本
  • 隐私敏感:文档内容需上传至第三方云端,不适合处理涉密材料
  • 超时限制:默认600秒超时,超大PDF可能需要调整参数
  • 错误静默:SDK设计为不抛异常,需主动检查result.to_dict()中的error字段

适合的目标群体

  • 企业知识管理:需要将历史纸质档案、扫描合同、发票凭证数字化的团队
  • RPA自动化:构建文档处理工作流的开发者,需要结构化提取表格数据
  • AI应用开发:为LLM应用提供文档理解能力的工程师,需将PDF转为Markdown供模型消费
  • 学术研究:需要批量解析论文、提取公式和表格的研究人员

常规使用风险

1. 密钥泄露风险:API Key需妥善保管,避免提交到版本控制或日志输出
2. 依赖项安全:实际运行时依赖用户本地安装的glmocr包,需从PyPI官方源安装

3. 数据残留:虽然云端处理,但需关注智谱AI的数据留存政策

4. 服务可用性:受智谱AI云服务SLA约束,关键业务需设计降级方案

GLM-OCR-SDK 内容

手动下载zip · 4.5 kB
SKILL.mdtext/markdown
请选择文件