核心功能
Screen Vision 是一款跨平台桌面自动化技能,通过「截图 → AI视觉分析 → 执行操作」的闭环机制,让AI代理具备人类般的屏幕理解与操控能力。支持Linux(含无头服务器)、macOS、Windows三大平台,可自动完成点击、输入、滚动、拖拽等鼠标键盘操作。
显著优点
跨平台兼容性:Linux采用XFCE4+noVNC方案实现无头服务器支持,macOS原生集成cliclick,Windows开箱即用pyautogui;智能Token优化:内置差异检测(diff_check.py),屏幕未变化时跳过分析,显著降低API调用成本;多模型支持:从GPT-5.4-Mini(约$0.03/任务)到Gemini(约$0.01/任务)乃至本地Ollama模型,灵活适配不同预算与质量需求;安全沙箱机制:自动拦截rm -rf、磁盘格式化、关机等高危命令,删除/支付类操作需二次确认,单次任务限制5分钟/100操作。
潜在局限
权限依赖:macOS需手动授予辅助功能权限,Linux无头环境需VNC层增加复杂度;视觉延迟:截图间隔默认1秒,快速动态界面可能错失关键帧;成本累积:GPT-5.4 CUA虽质量五星但单价$0.15/任务,高频使用成本显著;本地化门槛:Ollama模型虽免费但质量仅两星,复杂UI识别准确率有限。
适合人群
运维工程师(批量服务器配置)、测试自动化团队(跨平台GUI回归)、远程协助场景(跨地域设备操控)、效率极客(自动化重复性桌面任务)。尤其适合已有OpenAI/Gemini API密钥、熟悉基础命令行操作的技术用户。
常规风险
API密钥泄露风险(建议通过环境变量SV_VISION_API_KEY注入而非硬编码);截图日志持久化于/tmp/screen-vision/logs/,敏感界面可能被本地留存;网络波动导致vision API超时中断任务;差异检测算法在渐变动画场景下可能误判为无变化。