核心用法
Screen Vision 是一个基于视觉感知的桌面自动化 AI 技能,通过「截图 → AI 分析 → 执行操作」的闭环实现计算机自主控制。用户只需用自然语言描述任务,系统即可自动完成打开应用、浏览网页、填写表单、文件操作等 GUI 任务。
技术架构:
- 截图层:支持 Linux(scrot)、macOS(screencapture)、Windows(pyautogui) 三大平台
- 视觉分析:对接 GPT-5.4-Mini/CUA、Gemini、本地 Ollama 等多模态模型
- 执行层:通过 xdotool(Linux)、cliclick(macOS)、pyautogui(Windows) 模拟鼠标键盘
- 智能优化:Diff 检测机制避免重复截图,显著降低 Token 消耗
显著优点:
1. 跨平台兼容:覆盖主流操作系统,服务器无桌面环境也可运行(XFCE4+noVNC)
2. 模型灵活:从免费本地模型到 GPT-5.4 CUA 可选,成本区间 $0.01-$0.15/任务
3. 原生中文支持:关键词和示例包含完整中文指令
4. 自动化闭环:无需人工介入坐标定位,AI 自主识别 UI 元素
潜在局限:
- 依赖云端 API 存在网络延迟和隐私泄露风险
- 本地模型(Ollama)质量仅★★,复杂任务识别率低
- macOS 需手动授权辅助功能权限,配置门槛较高
- 动画/动态内容可能因截图时机导致识别偏差
适合人群:
- 远程服务器运维人员(无桌面环境自动化)
- 重复性 GUI 操作自动化需求者
- RPA/自动化测试开发者
- 无障碍辅助技术用户
常规风险:
- API 密钥硬编码或环境变量泄露风险
- 自动化操作可能误触敏感功能(已内置 rm -rf、格式化等危险命令拦截)
- 截图日志留存
/tmp/目录需定期清理防敏感信息泄露 - 支付/删除等操作需二次确认机制