vision ocr

📄 智能文档识别,一键飞书送达

支持图片/PDF文档的智能OCR识别,自动输出结构化Markdown并直发飞书会话,适合表格、票据、手写笔记等技术场景。

收藏
4.8k
安装
1.1k
版本
1.0.4
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

vision-ocr 是专为 OpenClaw 平台设计的文档识别技能,支持图片和 PDF 双模输入,输出结构化 Markdown。用户可通过自然语言指令触发,如「识别图片 /path/to/image.jpg」或「OCR 这个截图」。系统优先将识别结果发送到当前飞书会话,实现「截图→识别→发送」一键闭环。

显著优点

  • 多场景覆盖:支持文档截图、扫描件、表格票据、技术文档、多页 PDF 及手写内容
  • 智能识别策略:手写内容自动启用优化识别模式,复杂表格保留 HTML 结构
  • 飞书深度集成:自动获取会话上下文,识别结果直发当前群聊/私聊,无需手动复制
  • 多模态融合:OCR 结果与原图协同输入大模型,生成高质量结构化 Markdown

潜在局限

  • 上下文依赖:必须通过主会话 run(context) 调用才能自动发送,子会话或命令行模式丢失会话信息
  • 环境配置门槛:需配置 ImageOCR Token、多模态 API 等凭证,对私有化部署有一定要求
  • 隐私风险:默认开启飞书发送,敏感文档需显式关闭,存在误发风险

适合人群

飞书生态重度用户、需要批量处理文档/票据的行政/财务、希望将纸质笔记数字化的知识工作者、构建办公自动化的开发者。

常规风险

  • 敏感文件可能因 autoSendToFeishu: true 默认配置意外外传
  • 手写识别准确率受字迹清晰度影响,复杂排版可能出现结构错乱
  • 多页 PDF 大文件处理耗时较长,可能触发平台超时限制

vision ocr 内容

手动下载zip · 32.3 kB
config.example.jsonapplication/json
请选择文件