Upstage Document Parse

📄 复杂文档一键转结构化Markdown

Upstage文档解析API,支持PDF/图片/Office文档转结构化Markdown/HTML,精准保留表格、图表、公式等复杂版式,适合文档数字化与内容提取场景。

收藏
15.9k
安装
3.2k
版本
1.0.5
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能与用法

Upstage Document Parse 是一款面向复杂文档结构化的专业API服务,专注于将PDF、图片及Office文档(DOCX/PPTX/XLSX/HWP)转换为保留原始版式的结构化输出(Markdown/HTML)。其核心能力在于识别并还原表格、图片、图表、公式、多级标题等复杂版式元素,并附带精确的边界框坐标,支持下游的版式分析或可视化重渲染。

典型调用场景

  • 用户要求"将PDF转为Markdown"、"保留表格和布局提取内容"、"문서 구조 분석해줘"等明确指向结构化文档转换的需求
  • 文档包含复杂表格、多栏排版、图文混排等需要版式感知的处理任务

使用模式

  • 同步模式:≤100页、≤50MB、预期5分钟内完成,直接返回结果
  • 异步模式:支持至1000页,10页/批次处理,适用于大文档或批量任务

关键参数建议

  • mode=enhanced:复杂表格/图表/图片场景
  • ocr=force:扫描版PDF或图片强制启用OCR
  • merge_multipage_tables=true:跨页表格自动合并(增强模式限20页内)

显著优点

1. 版式保真度高:区别于纯文本OCR,能还原标题层级、表格结构、图片位置等视觉语义
2. 多格式统一支持:单一API覆盖PDF、Office、图片等主流文档类型

3. 坐标级可定位:每个元素附带归一化边界框,支持原文档位置回溯

4. 输出格式灵活:同步支持HTML、Markdown、纯文本,适应不同下游处理流程

潜在局限与风险

  • 非字段级提取:不适合发票金额、合同条款等特定字段的精准抽取(此类需求应使用 upstage-information-extraction)
  • 纯坐标文本场景不适用:仅需文字坐标而无版式需求的任务,应使用 upstage-ocr 以降低成本
  • 同步超时限制:5分钟服务端超时,大文档需切换异步模式增加实现复杂度
  • 增强模式页数限制:跨页表格合并仅限20页,超长表格可能断裂

适合人群

  • 需要将扫描档案、财报、论文、手册等转为可编辑结构化内容的开发者
  • 构建文档问答(RAG)、知识库入库、版式分析等需要保留文档结构的AI应用
  • 处理韩文文档(HWP/HWPX)的企业用户,Upstage对此有原生支持优势

常规风险提示

  • API密钥需通过环境变量管理,避免硬编码泄露
  • 异步任务结果保留期有限,需及时轮询获取
  • 大文件建议优先评估异步模式,避免同步超时导致的失败重试

Upstage Document Parse 内容

references文件夹
手动下载zip · 6.0 kB
async-workflow.mdtext/markdown
请选择文件