Claw Vision

👁️ AI 视觉解析,秒懂每张图

调用 Gemini 3.1 Pro Preview 对本地图片进行智能分析,支持截图、收据、文档、UI 界面等多种场景的结构化理解。

收藏
6.9k
安装
1.5k
版本
1.0.0
CLS 安全性认证2026-08-03
点击查看完整报告 >

使用说明

核心用法

claw-vision 是一款基于 Gemini 3.1 Pro Preview(NUWA Flux)的本地图像分析技能。用户通过发送图片文件或特定关键词(如"看一下这张图"),即可触发对 PNG、JPG、JPEG、GIF、WEBP 等格式的智能解析。系统通过 vision-tool.py 脚本调用云端多模态大模型,返回结构化的分析结果。

调用方式为命令行指令:

python3 ~/Documents/OpenClaw/workspace/scripts/vision-tool.py <图片绝对路径> "<提示语>"

输出遵循标准四字段格式:[summary] 提供内容概述;[fields] 提取关键文字或表格数据;[ui_elements] 罗列界面元素(针对 UI 截图);[confidence] 标注置信度等级(高/中/低)。

显著优点

  • 模型先进:底层采用 Google Gemini 3.1 Pro Preview,具备业界领先的视觉理解能力
  • 场景覆盖广:支持收据、文档、UI 界面、日常照片等多元场景
  • 输出结构化:标准化字段设计,便于下游自动化处理
  • 触发灵活:支持文件直传与语音关键词双重触发方式
  • 本地安全:仅处理本地文件路径,不涉及 URL 外链,降低传输风险

潜在缺点与局限性

  • 仅支持本地文件:明确不支持网络 URL,需用户先下载再上传
  • 依赖外部脚本:需确保 vision-tool.py 及 API 密钥配置正确
  • 格式限制:暂不支持 HEIC、RAW 等专业摄影格式
  • 中文语境优化:提示语默认中文,但底层模型为国际化训练,特定中文排版场景可能存在识别偏差
  • 无实时预览:需等待命令执行完成,无流式输出体验

适合人群

  • 需要批量处理截图信息的效率工作者
  • 从事 UI/UX 设计评审的产品团队
  • 希望快速提取收据、发票数据的财务人员
  • 构建本地自动化工作流的技术用户

常规风险

  • API 稳定性风险:Preview 版本模型可能存在服务波动或版本迭代
  • 数据隐私:图片需上传至 Google 云端处理,敏感文档存在合规考量
  • 路径注入风险:若图片路径来源不可控,需防范命令行注入攻击
  • 误识别风险:置信度标注为"低"时,关键决策需人工复核

综合评估

claw-vision 是 OpenClaw 生态中填补"视觉感知"空白的基础能力层,技术选型紧跟 Google 最前沿的多模态模型,定位清晰。适合对识别质量有较高要求、愿意承担一定云端依赖成本的场景用户。

安全解读

核心用法

claw-vision 是一款基于多模态大模型的图像理解技能,通过调用 Google Gemini 3.1 Pro Preview(NUWA Flux)实现本地图片的智能解析。用户发送图片文件或触发关键词(如"看一下这张图""截图里是什么")后,系统将调用 python3 ~/Documents/OpenClaw/workspace/scripts/vision-tool.py 执行分析,输出包含内容概述、关键字段提取、UI 元素列表及置信度评级的结构化结果。

该技能支持 PNG、JPG、JPEG、GIF、WEBP 等常见格式,仅限本地文件路径输入,不支持 URL 远程图片。典型应用场景包括: receipts 票据信息提取、UI 截图界面元素识别、文档内容结构化解析、照片场景描述等。输出采用固定模板格式,便于下游自动化处理。

显著优点

模型能力领先:Gemini 3.1 Pro Preview 作为 Google 最新多模态模型,在视觉理解、OCR、界面解析等任务上表现优异,支持复杂布局的文档和截图分析。

输出结构化:不同于简单的图像描述,该技能提供 [summary][fields][ui_elements][confidence] 四层结构化输出,可直接对接业务流程,减少后续解析成本。

触发方式灵活:同时支持文件上传和口语化关键词触发,降低用户使用门槛,适合集成到客服、办公自动化等对话式场景。

零代码集成:对于已部署外部脚本的用户,Skill 本身为纯 Markdown 文档,无需额外开发即可快速启用。

潜在缺点与局限性

外部依赖过重:核心功能完全依赖本地 vision-tool.py 脚本,该文件不在 Skill 包内,用户需自行安装配置。脚本缺失或版本不兼容将导致功能完全不可用。

隐私风险显著:所有图片数据需上传至 Google Gemini 云服务处理,无法本地运行。对于含敏感信息的截图(如身份证、银行账单、内部系统界面),存在数据外泄合规风险。

来源可追溯性差:发布者 puma1981 为个人开发者(T3 级别),无公开 GitHub 仓库可供审计,代码更新和维护依赖单一维护者,长期可用性存疑。

功能边界受限:仅支持本地文件路径,不支持 URL;依赖固定格式的外部脚本调用,难以自定义模型参数或输出格式;错误处理和重试机制未在文档中说明。

适合的目标群体

  • 办公效率用户:需要快速提取截图、票据、文档信息的个人工作者
  • 产品经理与设计师:需要批量分析 UI 截图、整理界面元素的团队协作场景
  • 自动化开发者:已具备 Python 环境,能够自行审查和部署外部脚本的开发人员
  • 轻量级视觉需求者:对图像理解有需求但不愿自行搭建多模态模型服务的中小团队

不适合人群:处理高度敏感图像的企业合规场景、无技术能力审查外部脚本的小白用户、要求完全离线运行的隐私敏感环境。

使用风险

供应链安全风险:外部脚本 vision-tool.py 若被篡改或植入恶意代码,可导致 API 密钥窃取、本地文件泄露等严重后果。建议在使用前完整审查脚本源码。

数据跨境与合规风险:图片数据发送至 Google 云服务,可能涉及跨境数据传输。企业用户需评估是否符合 GDPR、CCPA 等法规要求,以及内部数据出境审批流程。

服务可用性风险:依赖 Google Gemini API 的稳定性及计费策略,API 变更、额度耗尽或网络问题将直接影响功能可用性。

维护可持续性风险:个人开发者项目更新频率不确定,关键漏洞或模型升级可能无法及时跟进,建议具备自主维护能力或准备替代方案。

Claw Vision 内容

手动下载zip · 2.2 kB
skill-card.mdtext/markdown
请选择文件