GLM-OCR-SDK

📄 智谱官方文档解析SDK

智谱GLM-OCR官方SDK,云端API解析图片/PDF文档,提取文字、表格、公式为结构化JSON与Markdown,无需GPU,CLI一键调用。

收藏
3.4k
安装
969
版本
1.0.3
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

GLM-OCR SDK 是智谱AI官方推出的文档解析工具,基于云端MaaS API实现高精度OCR识别,支持图片、扫描件、PDF等多种格式。核心调用极为简洁:

  • Python APIglmocr.parse("document.pdf") 单句返回结构化结果
  • CLI工具glmocr parse image.png --api-key sk-xxx 无需配置直接运行
  • 返回格式:Markdown全文 + JSON结构化区域(含10类标签:标题、正文、表格、公式、图注等)

显著优点

1. 零硬件门槛:纯云端推理,无需GPU或本地模型部署
2. 结构化输出:自动识别版面布局,区分标题、表格、公式等区域,bounding box归一化至0-1000坐标系

3. Agent友好:支持--stdout直接输出到终端,配合jq可进行管道处理;提供to_dict()/to_json()便于工具链集成

4. 配置灵活:环境变量 > .env文件 > 构造函数参数多层级覆盖,无需YAML即可运行

5. 批处理支持:单文件、多文件、整个目录均可一键解析

潜在局限

  • 网络依赖:必须连接智谱云API,无法离线使用
  • 隐私敏感:文档内容需上传至第三方服务器,不适合机密级材料
  • 成本考量:按调用量计费,高频场景需评估API费用
  • 延迟问题:大文档默认600秒超时,极端场景需手动调整

适合人群

  • 需要快速集成文档解析能力的AI Agent开发者
  • 无GPU资源但需高精度版面分析的个人/小团队
  • 构建RAG流程、知识库自动化的工程场景

常规风险

  • 密钥泄露ZHIPU_API_KEY需妥善保管,避免硬编码提交至版本控制
  • 异常静默:SDK对MaaS错误不抛异常,需手动检查result.to_dict()中的error字段
  • JSON解析失败:模型返回异常时json_result可能为字符串,需容错处理

GLM-OCR-SDK 内容

手动下载zip · 4.5 kB
SKILL.mdtext/markdown
请选择文件