vision ocr

📄 一键识别,自动送达飞书

飞书场景专用 OCR 识别技能,支持图片/PDF/手写文档,自动发送结构化 Markdown 到当前会话,适合技术文档、票据、表格快速数字化。

收藏
2.4k
安装
1.1k
版本
1.0.8
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

vision-ocr 是 OpenClaw 生态中的文档识别技能,采用「OCR + 多模态大模型」双引擎架构。用户通过自然语言指令(如"识别这张截图")或程序化调用触发,支持本地文件路径、URL 或飞书附件作为输入。

标准调用流程
1. 输入层:接收图片/PDF/手写文档

2. 识别层:优先启用 OCR 引擎提取文字与结构

3. 增强层:将 OCR 结果与原图交由多模态模型生成最终 Markdown

4. 输出层:结构化 Markdown 自动发送至当前飞书会话

关键特性

  • 手写优化策略:自动检测手写内容并切换识别模式
  • 表格保留:复杂表格允许混合 HTML 保持格式
  • PDF 分页处理:支持多页文档逐页识别与基础信息提取
  • 会话感知:自动从 context.session 或环境变量恢复飞书会话上下文

显著优点

1. 飞书原生集成:唯一设计目标是「发送即识别、识别即发送」,会话上下文自动传递,无需手动指定接收方
2. 双引擎可靠性:OCR 失效时自动降级至图片描述模式,确保输出可用性

3. 手写专项优化:区别于通用 OCR 工具,对手写便条、批注有专门策略

4. 结构保持:技术文档的标题层级、代码块、表格格式尽量还原

潜在缺点与局限性

1. 强耦合飞书生态:脱离 OpenClaw/飞书上下文后,自动发送功能失效,沦为本地 OCR 工具
2. 配置依赖较重:需同时维护 ImageOCR Token、多模态 API、飞书发送技能三套凭据

3. 无独立 GUI:纯 Node.js 技能,需通过命令行或机器人会话交互

4. 隐私合规风险autoSendToFeishu 默认为 true,敏感文档存在误发风险

5. 子会话隔离陷阱:开发者易误在子会话调用导致发送失败,排查成本较高

适合人群

  • 飞书重度用户,需快速将截图/扫描件转为可编辑文档
  • 财务/行政人员处理票据、表格数字化
  • 技术团队归档代码截图、技术文档
  • OpenClaw 机器人开发者构建文档处理工作流

常规风险

  • 数据泄露:识别结果默认上传飞书,涉密文档需显式关闭发送
  • 凭据管理:config.json 或环境变量中的 Token 需定期轮换
  • 误触发:自然语言指令可能与其他技能冲突
  • 版本兼容性:依赖 feishu-send-files 技能,需保持版本同步

vision ocr 内容

手动下载zip · 39.4 kB
config.example.jsonapplication/json
请选择文件