pdf-ocr-layout

📄 多模态文档智能解析引擎

基于智谱 GLM 多模态模型的 PDF 深度解析工具,精准提取表格转 Markdown、自动裁剪图表,并融合 GLM-4.7 文本推理与 GLM-4.6V 视觉分析实现文档智能理解。

收藏
12.6k
安装
2.6k
版本
1.0.2
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

pdf-ocr-layout 是一款面向复杂文档的多模态深度分析工具,采用三阶段流水线架构:

1. 视觉提取层:调用 GLM-OCR 执行物理布局分析,识别表格、图片、图表等页面元素,输出带坐标(Bbox)的 HTML/Markdown 格式内容,并自动裁剪独立图像文件
2. 语义理解层

3. 输出整合:生成结构化 JSON,包含元素类型、坐标、原始内容及 AI 深度理解结果

  • 表格数据 → GLM-4.7 文本模型,结合全文上下文进行逻辑推理与业务含义解读
  • 图表/图片 → GLM-4.6V 多模态模型,基于图像 Base64 + 标题上下文进行视觉语义分析

支持 PDF、PNG、JPG 输入,命令行一键调用,输出目录自动管理。

显著优点

  • 高精度布局识别:GLM-OCR 专为文档解析优化,表格转 Markdown 格式规整,图表自动裁剪定位精准
  • 双模型协同推理:文本与视觉任务路由至最优模型,避免单一多模态模型在表格逻辑分析上的短板
  • 上下文感知理解:所有分析基于完整文档阅读顺序与段落关联,非孤立片段处理,解读更具连贯性
  • 工程友好:提供标准化 JSON 输出、清晰 CLI 接口,便于接入下游知识库或 RAG 系统

潜在局限

  • 单页限制:多页 PDF 默认仅处理首页,批量处理需自行扩展循环逻辑
  • 环境依赖:需配置智谱 API Key,且依赖 Pillow、BeautifulSoup4 等 Python 库
  • 成本考量:三模型级联调用(OCR + 4.7 + 4.6V)token 消耗较高,高频场景需评估成本
  • 中文生态绑定:底层模型均为智谱 GLM 系列,对非中文文档的优化程度待验证

适合人群

  • 金融/法律/科研领域需从研报、论文、合同中提取结构化数据的分析师
  • 构建文档问答 RAG 系统的开发者,需将图表转为可检索语义内容
  • 企业知识库建设者,需批量处理扫描件/PDF 并生成带理解注释的索引

常规风险

  • API 稳定性依赖智谱服务可用性,建议设置重试与降级机制
  • 敏感文档上传至第三方 API,需确认数据合规性与保密协议
  • 复杂手绘图表或低质量扫描件可能识别失败,建议预处理优化图像质量

pdf-ocr-layout 内容

script文件夹
手动下载zip · 11.2 kB
glm_ocr_extract.pytext/plain
请选择文件