核心功能
Desktop Computer Automation 是一款基于 Midscene.js 的视觉驱动型桌面自动化工具,支持 macOS、Windows 和 Linux 三大平台。其核心突破在于纯视觉识别——完全依赖屏幕截图分析,无需访问 DOM 或系统无障碍 API,即可与桌面上任何可见元素交互,无论目标应用基于何种技术栈(Electron、Qt、原生应用等)。
显著优点
1. 零侵入式集成:不依赖应用代码改造,适用于所有桌面应用,包括无法浏览器化的原生程序
2. 自然语言驱动:使用 "搜索上海天气并告诉我结果" 等人类指令即可完成多步骤复杂操作
3. 多模态定位:支持参考图像精确匹配(tap --locate),结合文字描述与视觉参照定位目标
4. 完整工作流闭环:从连接、执行到断言验证(assert),内置健康检查与自动化报告生成
5. 跨模型兼容:支持 Gemini、Qwen、Doubao Seed、GLM-4.6V 等主流多模态模型
潜在局限与风险
| 风险类型 | 说明 |
|---------|------|
| **系统权限** | 需授予终端辅助功能权限(Accessibility),否则无法模拟输入 |
| **屏幕锁定** | macOS 锁屏时无法截图,需改用屏保模式保持会话活跃 |
| **执行耗时** | 单次 `act` 命令涉及 AI 推理+屏幕交互,通常需 1 分钟以上 |
| **同步限制** | 严禁后台执行,必须串行等待,复杂任务链耗时累积 |
| **硬件占用** | 接管真实鼠标键盘,期间用户难以并行操作 |
适合人群
- QA 工程师:测试跨平台 Electron/原生桌面应用
- RPA 开发者:构建无需 API 的传统应用自动化流程
- 技术支持:远程协助用户完成复杂界面操作
- 效率极客:自动化重复性桌面任务(文件整理、应用配置等)
使用建议
务必遵循"单命令同步执行"原则,每次 act 后读取截图再决策下一步。优先将相关操作批量写入单一自然语言指令,减少推理往返。对于 Web 应用,官方明确建议改用 Browser Automation 替代,避免不必要的桌面接管开销。