核心用法
vision-ocr 是 OpenClaw 生态中的文档识别技能,采用「OCR + 多模态大模型」双引擎架构。用户通过自然语言指令(如"识别这张截图")或程序化调用触发,支持本地文件路径、URL 或飞书附件作为输入。
标准调用流程:
1. 输入层:接收图片/PDF/手写文档
2. 识别层:优先启用 OCR 引擎提取文字与结构
3. 增强层:将 OCR 结果与原图交由多模态模型生成最终 Markdown
4. 输出层:结构化 Markdown 自动发送至当前飞书会话
关键特性:
- 手写优化策略:自动检测手写内容并切换识别模式
- 表格保留:复杂表格允许混合 HTML 保持格式
- PDF 分页处理:支持多页文档逐页识别与基础信息提取
- 会话感知:自动从
context.session或环境变量恢复飞书会话上下文
显著优点
1. 飞书原生集成:唯一设计目标是「发送即识别、识别即发送」,会话上下文自动传递,无需手动指定接收方
2. 双引擎可靠性:OCR 失效时自动降级至图片描述模式,确保输出可用性
3. 手写专项优化:区别于通用 OCR 工具,对手写便条、批注有专门策略
4. 结构保持:技术文档的标题层级、代码块、表格格式尽量还原
潜在缺点与局限性
1. 强耦合飞书生态:脱离 OpenClaw/飞书上下文后,自动发送功能失效,沦为本地 OCR 工具
2. 配置依赖较重:需同时维护 ImageOCR Token、多模态 API、飞书发送技能三套凭据
3. 无独立 GUI:纯 Node.js 技能,需通过命令行或机器人会话交互
4. 隐私合规风险:autoSendToFeishu 默认为 true,敏感文档存在误发风险
5. 子会话隔离陷阱:开发者易误在子会话调用导致发送失败,排查成本较高
适合人群
- 飞书重度用户,需快速将截图/扫描件转为可编辑文档
- 财务/行政人员处理票据、表格数字化
- 技术团队归档代码截图、技术文档
- OpenClaw 机器人开发者构建文档处理工作流
常规风险
- 数据泄露:识别结果默认上传飞书,涉密文档需显式关闭发送
- 凭据管理:config.json 或环境变量中的 Token 需定期轮换
- 误触发:自然语言指令可能与其他技能冲突
- 版本兼容性:依赖 feishu-send-files 技能,需保持版本同步