核心用法
vision-ocr 是专为 OpenClaw 平台设计的文档识别技能,支持图片和 PDF 双模输入,输出结构化 Markdown。用户可通过自然语言指令触发,如「识别图片 /path/to/image.jpg」或「OCR 这个截图」。系统优先将识别结果发送到当前飞书会话,实现「截图→识别→发送」一键闭环。
显著优点
- 多场景覆盖:支持文档截图、扫描件、表格票据、技术文档、多页 PDF 及手写内容
- 智能识别策略:手写内容自动启用优化识别模式,复杂表格保留 HTML 结构
- 飞书深度集成:自动获取会话上下文,识别结果直发当前群聊/私聊,无需手动复制
- 多模态融合:OCR 结果与原图协同输入大模型,生成高质量结构化 Markdown
潜在局限
- 上下文依赖:必须通过主会话
run(context)调用才能自动发送,子会话或命令行模式丢失会话信息 - 环境配置门槛:需配置 ImageOCR Token、多模态 API 等凭证,对私有化部署有一定要求
- 隐私风险:默认开启飞书发送,敏感文档需显式关闭,存在误发风险
适合人群
飞书生态重度用户、需要批量处理文档/票据的行政/财务、希望将纸质笔记数字化的知识工作者、构建办公自动化的开发者。
常规风险
- 敏感文件可能因
autoSendToFeishu: true默认配置意外外传 - 手写识别准确率受字迹清晰度影响,复杂排版可能出现结构错乱
- 多页 PDF 大文件处理耗时较长,可能触发平台超时限制