Screen Vision

🖥️ AI视觉操控电脑 · 自动化桌面代理

AI视觉操控桌面,支持截图-分析-执行闭环,跨平台自动化GUI任务,内置安全防护机制

收藏
2.1k
安装
982
版本
1.0.3
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能

Screen Vision 是一款跨平台桌面自动化技能,通过「截图 → AI视觉分析 → 执行操作」的闭环机制,让AI代理具备人类般的屏幕理解与操控能力。支持Linux(含无头服务器)、macOS、Windows三大平台,可自动完成点击、输入、滚动、拖拽等鼠标键盘操作。

显著优点

跨平台兼容性:Linux采用XFCE4+noVNC方案实现无头服务器支持,macOS原生集成cliclick,Windows开箱即用pyautogui;智能Token优化:内置差异检测(diff_check.py),屏幕未变化时跳过分析,显著降低API调用成本;多模型支持:从GPT-5.4-Mini(约$0.03/任务)到Gemini(约$0.01/任务)乃至本地Ollama模型,灵活适配不同预算与质量需求;安全沙箱机制:自动拦截rm -rf、磁盘格式化、关机等高危命令,删除/支付类操作需二次确认,单次任务限制5分钟/100操作。

潜在局限

权限依赖:macOS需手动授予辅助功能权限,Linux无头环境需VNC层增加复杂度;视觉延迟:截图间隔默认1秒,快速动态界面可能错失关键帧;成本累积:GPT-5.4 CUA虽质量五星但单价$0.15/任务,高频使用成本显著;本地化门槛:Ollama模型虽免费但质量仅两星,复杂UI识别准确率有限。

适合人群

运维工程师(批量服务器配置)、测试自动化团队(跨平台GUI回归)、远程协助场景(跨地域设备操控)、效率极客(自动化重复性桌面任务)。尤其适合已有OpenAI/Gemini API密钥、熟悉基础命令行操作的技术用户。

常规风险

API密钥泄露风险(建议通过环境变量SV_VISION_API_KEY注入而非硬编码);截图日志持久化于/tmp/screen-vision/logs/,敏感界面可能被本地留存;网络波动导致vision API超时中断任务;差异检测算法在渐变动画场景下可能误判为无变化。

Screen Vision 内容

references文件夹
scripts文件夹
core文件夹
platform文件夹
setup文件夹
vision文件夹
手动下载zip · 26.9 kB
API_CONFIG.mdtext/markdown
请选择文件