openocr-skill

📄 智能 OCR 识别与文档解析

基于 OpenOCR 的多功能文字识别工具,支持文本检测、识别、公式表格解析及文档版面分析,可处理图片与 PDF。

收藏
5.9k
安装
2.6k
版本
0.1.5
CLS 安全扫描中
预计需要 3 分钟...

使用说明

OpenOCR Skill 是一款集成开源 OpenOCR 库的通用 OCR 技能,提供文本检测、识别、端到端 OCR、基于 VLM 的通用识别(公式/表格/文本)以及文档版面分析五大核心能力。该技能采用模块化设计,用户可根据场景选择 mobile(快速)或 server(精准)模式,并支持 ONNX(默认)与 PyTorch 双后端。核心优势在于其轻量级 VLM(仅 0.1B 参数)实现的通用识别能力,可输出 LaTeX 格式的数学公式与表格,且文档解析功能能自动生成结构化 Markdown。局限性方面,手写体识别准确率波动较大,复杂旋转文本处理能力有限,server 模式依赖 PyTorch 环境且速度较慢;PDF 处理需逐页转图,大文件内存占用较高。适合学术研究者处理论文公式、财务人员提取表格数据、开发者构建文档数字化流水线,以及需要多语言(中英为主)OCR 的通用场景。常规风险包括:处理敏感文档时可能产生隐私泄露,GPU 环境配置不当导致推理失败,以及自动下载模型时的网络与完整性校验问题。

openocr-skill 内容

手动下载zip · 5.6 kB
SKILL.mdtext/markdown
请选择文件