Screen Vision

🖥️ AI视觉自主操控电脑

AI视觉控制桌面自动化工具,支持跨平台截图-分析-执行循环,实现鼠标键盘自主操作,内置安全防护机制。

收藏
4.3k
安装
982
版本
1.0.5
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Screen Vision 是一个基于视觉感知的桌面自动化 AI 技能,通过「截图 → AI 分析 → 执行操作」的闭环实现计算机自主控制。用户只需用自然语言描述任务,系统即可自动完成打开应用、浏览网页、填写表单、文件操作等 GUI 任务。

技术架构

  • 截图层:支持 Linux(scrot)、macOS(screencapture)、Windows(pyautogui) 三大平台
  • 视觉分析:对接 GPT-5.4-Mini/CUA、Gemini、本地 Ollama 等多模态模型
  • 执行层:通过 xdotool(Linux)、cliclick(macOS)、pyautogui(Windows) 模拟鼠标键盘
  • 智能优化:Diff 检测机制避免重复截图,显著降低 Token 消耗

显著优点
1. 跨平台兼容:覆盖主流操作系统,服务器无桌面环境也可运行(XFCE4+noVNC)

2. 模型灵活:从免费本地模型到 GPT-5.4 CUA 可选,成本区间 $0.01-$0.15/任务

3. 原生中文支持:关键词和示例包含完整中文指令

4. 自动化闭环:无需人工介入坐标定位,AI 自主识别 UI 元素

潜在局限

  • 依赖云端 API 存在网络延迟和隐私泄露风险
  • 本地模型(Ollama)质量仅★★,复杂任务识别率低
  • macOS 需手动授权辅助功能权限,配置门槛较高
  • 动画/动态内容可能因截图时机导致识别偏差

适合人群

  • 远程服务器运维人员(无桌面环境自动化)
  • 重复性 GUI 操作自动化需求者
  • RPA/自动化测试开发者
  • 无障碍辅助技术用户

常规风险

  • API 密钥硬编码或环境变量泄露风险
  • 自动化操作可能误触敏感功能(已内置 rm -rf、格式化等危险命令拦截)
  • 截图日志留存 /tmp/ 目录需定期清理防敏感信息泄露
  • 支付/删除等操作需二次确认机制

Screen Vision 内容

references文件夹
scripts文件夹
core文件夹
platform文件夹
setup文件夹
vision文件夹
手动下载zip · 26.9 kB
API_CONFIG.mdtext/markdown
请选择文件