核心用法
Screen Vision 是一款基于AI视觉的桌面自动化技能,通过「截图→AI分析→执行动作」的闭环循环,让AI代理能够像人类一样观察屏幕、理解UI元素,并自主完成鼠标点击、键盘输入、滚动拖拽等操作。
典型工作流程:
1. 环境初始化:根据平台(Linux/macOS/Windows)一键安装依赖,Linux服务器支持无桌面模式(XFCE4+noVNC)
2. 任务执行:调用 run_task.py 传入自然语言任务描述,系统自动循环截图、分析、执行直至完成
3. 智能优化:内置diff检测跳过无变化截图,节省API token消耗
技术架构亮点:
- 多平台统一抽象:Linux用xdotool、macOS用cliclick、Windows用pyautogui
- 多模型支持:GPT-5.4-Mini(性价比)、GPT-5.4 CUA(专业级)、Gemini(低成本)、本地Ollama(免费)
- 8种核心动作:click/type/key/scroll/drag/wait/done/failed
显著优点
- 真正视觉驱动:不依赖DOM或API,纯视觉识别适配任何桌面应用
- 极低门槛:自然语言描述任务,无需编写自动化脚本
- 成本可控:Mini模型单次任务约$0.03,diff检测进一步降本
- 企业级安全:危险操作黑名单(rm -rf/format/shutdown)、敏感操作二次确认、5分钟/100动作硬限制
潜在局限
- 延迟敏感:每次截图+API调用引入1-3秒延迟,不适合高速游戏场景
- 视觉依赖:界面剧变(弹窗遮挡、分辨率切换)可能导致识别失败
- API成本累积:复杂任务(100动作×$0.03)可能达$3/任务,高频使用需本地模型
- 权限门槛:macOS需Accessibility权限,部分企业环境可能受限
适合人群
- 远程运维:服务器无桌面环境下的GUI应用操作
- 自动化测试:跨平台UI回归测试,无需维护元素选择器
- 无障碍辅助:语音指令操控电脑,视障用户辅助工具
- 效率玩家:重复性表单填写、数据录入、跨应用工作流
常规风险
- 隐私泄露:截图上传第三方API(建议本地模型处理敏感界面)
- 误操作风险:AI可能误识别按钮位置,建议沙箱环境首次验证
- 服务依赖:API故障或额度耗尽时自动停止,需监控日志目录
/tmp/screen-vision/logs/