GLM-OCR-SDK

📄 智谱云端文档识别,零 GPU 结构化提取

基于智谱 GLM-OCR 的云端文档解析 SDK,支持图片/PDF 文字、表格、公式提取,无需 GPU,返回结构化 JSON 与 Markdown。

收藏
2k
安装
969
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

GLM-OCR Skill 综合评估

核心用法

GLM-OCR Skill 封装了智谱 AI 的 GLM-OCR 云端文档解析 SDK,提供零配置、即装即用的文档结构化提取能力。用户通过 pip install glmocr 安装后,仅需设置环境变量 GLMOCR_API_KEY 即可调用,无需本地 GPU 或复杂配置文件。

主要功能

  • 多格式输入:支持 JPG、PNG、PDF、BMP、WebP 等常见文档格式
  • 结构化输出:返回带标签的区域识别结果(标题、正文、表格、公式、图表等)及标准 Markdown
  • 双模式支持:默认 MaaS 云端模式(推荐)+ 自托管 vLLM/SGLang 本地模式
  • 灵活调用:Python API(单次/批量)与 CLI 工具并行,支持 stdout 管道输出便于 Agent 集成

典型工作流

import glmocr
result = glmocr.parse("invoice.pdf")
tables = [r for r in result.json_result[0] if r["label"] == "table"]

显著优点

1. 零硬件门槛:纯云端推理,彻底摆脱本地 GPU 依赖,适合轻量环境
2. Agent 原生设计:CLI 支持 --stdout --json-only --no-save 管道模式,便于 LLM Agent 集成

3. 配置极简:环境变量 > .env 文件 > 代码传参的优先级设计,无需编辑 YAML

4. 布局感知:内置版面分析,自动区分标题、表格、公式、印章等区域,优于传统 OCR

5. 批处理能力:原生支持目录批量处理,适合发票、合同等规模化场景

6. 智谱背书:底层模型由智谱 AI 提供,中文文档理解能力领先

潜在缺点与局限性

1. 网络依赖:MaaS 模式必须联网,无法离线使用;API 故障时完全不可用
2. 成本敏感:按量计费模式,高频调用或大型 PDF 可能产生显著费用

3. 隐私风险:敏感文档需上传至智谱云端,金融、医疗等强合规场景受限

4. 超时限制:默认 600s 超时,超大文档(如数百页扫描件)可能中断

5. 错误静默:SDK 对 MaaS 错误不抛异常,需手动检查 result.to_dict()["error"],易遗漏失败

6. 非标图像弱:明确不适用于实时视频流、普通照片、插画等非文档图像

适合人群

  • 自动化 Agent 开发者:需要结构化文档输入的 RAG、知识库构建系统
  • 企业办公自动化:发票识别、合同提取、报表数字化等批量处理场景
  • 轻量环境用户:无 GPU 的笔记本、服务器、CI/CD 流水线
  • 中文文档优先:财报、论文、公文等复杂版面的中文材料处理

常规风险

  • 数据泄露:文档内容上传第三方云端,需评估信息敏感度
  • API 密钥管理GLMOCR_API_KEY 泄露可能导致账号被盗刷
  • 供应商锁定:深度绑定智谱 API,迁移至其他 OCR 服务需重构代码
  • 计费失控:批量任务未设限可能导致意外高额账单,建议配置用量告警

GLM-OCR-SDK 内容

手动下载zip · 4.4 kB
SKILL.mdtext/markdown
请选择文件