核心用法
GLM-OCR SDK 是智谱AI官方推出的文档解析工具,基于云端MaaS API实现高精度OCR识别,支持图片、扫描件、PDF等多种格式。核心调用极为简洁:
- Python API:
glmocr.parse("document.pdf")单句返回结构化结果 - CLI工具:
glmocr parse image.png --api-key sk-xxx无需配置直接运行 - 返回格式:Markdown全文 + JSON结构化区域(含10类标签:标题、正文、表格、公式、图注等)
显著优点
1. 零硬件门槛:纯云端推理,无需GPU或本地模型部署
2. 结构化输出:自动识别版面布局,区分标题、表格、公式等区域,bounding box归一化至0-1000坐标系
3. Agent友好:支持--stdout直接输出到终端,配合jq可进行管道处理;提供to_dict()/to_json()便于工具链集成
4. 配置灵活:环境变量 > .env文件 > 构造函数参数多层级覆盖,无需YAML即可运行
5. 批处理支持:单文件、多文件、整个目录均可一键解析
潜在局限
- 网络依赖:必须连接智谱云API,无法离线使用
- 隐私敏感:文档内容需上传至第三方服务器,不适合机密级材料
- 成本考量:按调用量计费,高频场景需评估API费用
- 延迟问题:大文档默认600秒超时,极端场景需手动调整
适合人群
- 需要快速集成文档解析能力的AI Agent开发者
- 无GPU资源但需高精度版面分析的个人/小团队
- 构建RAG流程、知识库自动化的工程场景
常规风险
- 密钥泄露:
ZHIPU_API_KEY需妥善保管,避免硬编码提交至版本控制 - 异常静默:SDK对MaaS错误不抛异常,需手动检查
result.to_dict()中的error字段 - JSON解析失败:模型返回异常时
json_result可能为字符串,需容错处理