Vision Helper — AI Image Analysis

📸 AI 视觉分析,本地云端双模支持

通过 Ollama 调用本地/云端视觉模型分析图像,支持 OCR、UI 识别、截图分析,180 秒超时保障云端模型稳定运行

收藏
5.2k
安装
1.1k
版本
1.0.0
CLS 安全性认证2026-07-14
点击查看完整报告 >

使用说明

Vision Helper — 图像分析技能评估

核心用法

Vision Helper 是一款基于 Ollama 的视觉模型调用工具,专为解决内置 image 工具在云端模型上的超时问题而设计。通过直接调用 Ollama API 并将超时延长至 180 秒,该技能能够稳定支持本地轻量模型与云端大模型的图像分析需求。

主要功能场景:

  • 截图分析:浏览器/桌面截图的自动识别与 UI 元素解析
  • OCR 文本提取:从图片中提取文字内容
  • 游戏/应用自动化:截图 → 分析状态 → 触发下一步操作
  • 多语言支持:支持中英文及自定义提示词

执行方式:

# 基础分析
python3 <skill-dir>/scripts/analyze_image.py <image_path>

# 自定义提示词与模型
python3 <skill-dir>/scripts/analyze_image.py <image_path> "描述内容" kimi-k2.5:cloud

显著优点

1. 超时优化:180 秒超时设计,完美适配云端视觉模型(通常需 40–120 秒),彻底解决内置工具超时失败问题
2. 路径无限制:绕过内置工具的文件路径限制,可读取任意可访问目录的图像

3. 模型灵活:支持本地隐私优先模型(gemma4:31b)与云端高质量模型(kimi-k2.6、qwen3.5 系列)

4. 工作流集成:提供浏览器截图→分析、桌面截图→分析、游戏 UI→决策的完整自动化链路

5. 零 API 成本:本地模型运行无需调用费用,隐私数据不出境

潜在缺点与局限性

1. 依赖 Ollama:需预先部署 Ollama 服务及相应视觉模型,新手配置门槛较高
2. 云端模型延迟:高质量云端模型响应时间长达 40–120 秒,实时性场景受限

3. 硬件要求:本地 31B 参数模型对 GPU 显存和算力有较高要求

4. 环境耦合:技能路径硬编码依赖 ~/.openclaw/workspace/skills/vision-helper/,迁移需手动调整

5. 无视觉验证:脚本本身不校验图像内容有效性,错误输入可能导致异常输出

适合人群

  • 自动化开发者:需要构建截图→分析→决策闭环的 RPA/游戏脚本开发者
  • 隐私敏感用户:偏好本地运行、避免图像数据上传云端的用户
  • 多模型对比研究者:需要灵活切换本地/云端模型进行效果评估的技术人员
  • UI 测试工程师:需要批量验证页面渲染结果的测试场景

常规风险

  • 超时配置不当:未将 exec 工具超时设为 120–180 秒时,云端模型调用仍会失败
  • 模型可用性:云端模型标签(如 :cloud)需确保 Ollama 实例已正确配置对应模型
  • 路径注入:虽然技能声称无路径限制,但未对输入路径进行严格校验,存在路径遍历潜在风险
  • 资源耗尽:连续调用大参数云端模型可能导致 Ollama 服务端资源占用过高
  • 误识别风险:视觉模型对复杂 UI、低分辨率图像或小字体的识别准确率存在固有局限

安全解读

核心用法

vision-helper 是一个专为 OpenClaw 环境设计的图像分析 Skill,通过直接调用 Ollama API 实现视觉模型的图像理解能力。与内置 image 工具相比,其核心差异在于180秒超长超时设计,专为解决云端视觉模型(如 Kimi、Qwen 系列)响应慢(40–120秒)导致的超时失败问题。

使用场景覆盖三大典型工作流:
1. 浏览器截图分析:配合 browser(action="screenshot") 获取页面截图,分析 UI 状态、验证加载结果

2. 桌面截图识别:通过 screencapture/gnome-screenshot/scrot 等系统工具捕获屏幕,执行 OCR 或界面元素分析

3. 游戏/应用自动化:截屏 → 识别游戏状态/UI 按钮 → 驱动后续自动化操作

命令行调用格式为 python3 <skill-dir>/scripts/analyze_image.py <图片路径> [自定义提示词] [指定模型],支持通过 VISION_MODELVISION_TIMEOUTOLLAMA_API_URL 环境变量灵活配置。

显著优点

  • 超时兼容性:180秒超时 vs 内置工具的有限超时,云模型不再因响应慢而失败
  • 路径无限制:突破内置工具的文件路径白名单,可读取任意可读目录的图像
  • 双模支持:本地模型(gemma4:31b,隐私优先、离线可用)与云端模型(Kimi/Qwen 系列,高质量识别)无缝切换
  • 零依赖部署:纯 Python 标准库实现,无第三方包,彻底消除供应链攻击面
  • 多格式支持:PNG/JPG/GIF/WebP/BMP/TIFF/SVG,单文件上限 20MB
  • 输入防护完善:路径遍历过滤(.. 检测)、扩展名白名单、空文件检测、大小限制四重验证

潜在缺点与局限性

  • 基础设施依赖:必须自行部署 Ollama 服务,本地模型需 20GB+ 显存(Gemma 4 31B),门槛较高
  • 云模型成本:Kimi/Qwen 云端调用可能产生 API 费用,且 40–120秒延迟影响实时性
  • 网络配置风险:默认 HTTP 连接 localhost,若误配置为远程未加密端点,图像数据存在传输泄露风险
  • 无内置截图:需配合外部工具(browser/exec)完成截图,非端到端闭环方案
  • 中文提示需显式指定:无自动语言检测,需手动传入中文提示词

适合人群

  • 自动化测试开发者:需要验证页面渲染、识别 UI 元素位置
  • 游戏脚本编写者:基于视觉状态判断实现游戏自动化
  • 隐私敏感用户:倾向本地 Gemma 模型,拒绝图像数据外传
  • 云模型重度用户:依赖 Kimi/Qwen 的高质量 OCR/理解,能容忍延迟
  • RPA/桌面自动化场景:需要分析桌面应用界面并驱动后续操作

常规风险

| 风险类型 | 说明 | 缓解措施 |
|---------|------|---------|
| 数据泄露 | 图像发送至云端模型时可能暴露敏感信息 | 敏感内容强制使用本地 `gemma4:31b`;文档已明确风险提示 |
| 端点劫持 | `OLLAMA_API_URL` 被恶意配置为第三方服务 | 限制环境变量写入权限;默认锁定 localhost |
| 路径遍历 | 恶意构造 `../../../etc/passwd` 类路径 | 已实施 `..` 过滤与路径规范化 |
| 大文件 DoS | 超大图像导致内存/网络资源耗尽 | 20MB 大小限制 + 超时熔断 |
| 供应链攻击 | 依赖包被投毒 | 纯标准库实现,零第三方依赖 |

该 Skill 安全认证评级 S 级(92分),信任等级 T3(个人开发者/社区项目),已通过 GDPR、CCPA 等合规检测,无已知 CVE 漏洞。

Vision Helper — AI Image Analysis 内容

scripts文件夹
手动下载zip · 5.9 kB
analyze_image.pytext/plain
请选择文件