核心用法
vision-ocr 是一款专为 OpenClaw 设计的文档智能识别技能,支持图片与 PDF 双模输入,输出结构化 Markdown 格式。用户可通过自然语言指令触发识别,如「识别图片 /path/to/image.jpg」或「OCR 这个截图」。技能深度整合多模态大模型能力,在 OCR 结果有效时结合原图生成最终 Markdown,确保内容还原度;OCR 失效时自动切换至图片描述模式兜底。
技能特别针对飞书生态优化:在主会话中直接调用 visionOcr.run(context) 并显式开启发送开关,即可将识别结果自动推送至当前群聊或私聊会话。对于多页 PDF,支持逐页 OCR 与基础信息提取;手写内容(便条、批注)自动启用手写优先识别策略,提升识别准确率。
显著优点
1. 多场景适配:覆盖文档截图、扫描件、表格票据、技术文档、手写便条等六大高频场景,满足办公全链路需求。
2. 飞书原生集成:识别结果可直接发送至当前飞书会话,无需手动复制粘贴,实现「发送-识别-归档」一站式闭环,显著提升团队协作效率。
3. 安全设计完善:敏感功能(飞书发送、远程文件下载、CLI 会话恢复)均默认关闭,需用户显式授权;1.1.2 版本新增 SSRF 过滤(禁止 localhost/私有网段)、下载大小限制(50MB)及超时控制(15 秒),从源头降低安全风险。
4. 输出格式友好:优先保留原始文档结构,复杂表格允许混合 HTML 表格输出,兼顾 Markdown 可读性与排版准确性。
5. 依赖精简可控:无第三方 npm 依赖,仅依赖 Python PyMuPDF 处理 PDF,降低供应链攻击面。
潜在缺点与局限性
1. 飞书发送受限:必须在主会话中直接调用且显式开启发送开关,子会话或 CLI 模式无法自动发送,对技术小白不够友好。
2. 外部服务依赖:核心功能依赖用户自行配置的 ImageOCR 与多模态 API,服务稳定性与识别质量受第三方服务商制约。
3. 手写识别边界:虽对手写内容有优化策略,但极端潦草字迹、艺术字体或低分辨率手写图片仍可能出现识别偏差。
4. 复杂表格还原:Markdown 表格语法有限,极复杂表格可能以 HTML 混合输出,在部分纯 Markdown 渲染环境显示效果受限。
适合的目标群体
- 飞书深度用户:已在飞书生态中开展协作的办公团队,需将纸质/图片文档快速转为可编辑文本。
- 行政与财务人员:频繁处理发票、合同扫描件、报销票据等结构化文档的职能岗位。
- 技术文档维护者:需要将技术手册、API 文档截图转为 Markdown 归档的开发者或产品经理。
- 教育与研究场景:学生、教师、研究人员用于整理手写笔记、扫描版论文、教材图片等。
使用风险
1. 数据外泄风险:识别过程中图片与文本会发送至用户配置的第三方 OCR/多模态服务,敏感文档建议添加 --no-send-to-feishu 参数并自行部署私有化服务。
2. 子进程执行风险:PDF 处理通过 execFileSync 调用 Python 脚本,虽采用参数数组而非字符串拼接降低注入风险,但仍建议对输入路径严格校验文件扩展名。
3. 远程下载风险:远程附件下载功能需显式开启,虽已有 SSRF 防护,但生产环境建议仅在可信网络内启用。
4. 服务可用性风险:外部 API 调用失败时技能可能降级至图片描述模式,关键业务场景建议配置多服务商容灾策略。