Screen Vision

🖥️ AI视觉操控电脑,所见即所控

AI视觉桌面控制,让AI通过截图-分析-执行循环自主操控鼠标键盘,支持跨平台远程自动化

收藏
3k
安装
982
版本
1.0.6
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Screen Vision 是一款基于AI视觉的桌面自动化技能,通过「截图→AI分析→执行动作」的闭环循环,让AI代理能够像人类一样观察屏幕、理解UI元素,并自主完成鼠标点击、键盘输入、滚动拖拽等操作。

典型工作流程
1. 环境初始化:根据平台(Linux/macOS/Windows)一键安装依赖,Linux服务器支持无桌面模式(XFCE4+noVNC)

2. 任务执行:调用 run_task.py 传入自然语言任务描述,系统自动循环截图、分析、执行直至完成

3. 智能优化:内置diff检测跳过无变化截图,节省API token消耗

技术架构亮点

  • 多平台统一抽象:Linux用xdotool、macOS用cliclick、Windows用pyautogui
  • 多模型支持:GPT-5.4-Mini(性价比)、GPT-5.4 CUA(专业级)、Gemini(低成本)、本地Ollama(免费)
  • 8种核心动作:click/type/key/scroll/drag/wait/done/failed

显著优点

  • 真正视觉驱动:不依赖DOM或API,纯视觉识别适配任何桌面应用
  • 极低门槛:自然语言描述任务,无需编写自动化脚本
  • 成本可控:Mini模型单次任务约$0.03,diff检测进一步降本
  • 企业级安全:危险操作黑名单(rm -rf/format/shutdown)、敏感操作二次确认、5分钟/100动作硬限制

潜在局限

  • 延迟敏感:每次截图+API调用引入1-3秒延迟,不适合高速游戏场景
  • 视觉依赖:界面剧变(弹窗遮挡、分辨率切换)可能导致识别失败
  • API成本累积:复杂任务(100动作×$0.03)可能达$3/任务,高频使用需本地模型
  • 权限门槛:macOS需Accessibility权限,部分企业环境可能受限

适合人群

  • 远程运维:服务器无桌面环境下的GUI应用操作
  • 自动化测试:跨平台UI回归测试,无需维护元素选择器
  • 无障碍辅助:语音指令操控电脑,视障用户辅助工具
  • 效率玩家:重复性表单填写、数据录入、跨应用工作流

常规风险

  • 隐私泄露:截图上传第三方API(建议本地模型处理敏感界面)
  • 误操作风险:AI可能误识别按钮位置,建议沙箱环境首次验证
  • 服务依赖:API故障或额度耗尽时自动停止,需监控日志目录 /tmp/screen-vision/logs/

Screen Vision 内容

references文件夹
scripts文件夹
core文件夹
platform文件夹
setup文件夹
vision文件夹
手动下载zip · 26.9 kB
API_CONFIG.mdtext/markdown
请选择文件