Midscene Automations Skills for Computer

🖥️ 自然语言操控你的电脑屏幕

automation榜 #16

基于Midscene的视觉驱动桌面自动化工具,通过自然语言控制跨平台桌面操作,无需DOM或无障碍标签,完全依赖屏幕截图进行UI交互。

收藏
11.7k
安装
2.7k
版本
1.0.2
CLS 安全性认证2026-06-23
点击查看完整报告 >

使用说明

核心用法

Desktop Computer Automation 是一个基于 Midscene.js 的视觉驱动桌面自动化技能,支持 macOS、Windows 和 Linux 三大平台。其核心工作原理是通过屏幕截图捕获当前桌面状态,利用多模态大语言模型(MLLM)进行视觉理解和 grounding,从而识别屏幕上的UI元素并执行相应的鼠标点击、键盘输入、拖拽等操作。

使用流程遵循严格的同步模式:
1. 连接会话 (connect) — 建立与桌面的通信通道

2. 健康检查 — 验证截图和鼠标移动功能正常

3. 应用前置 — 确保目标应用已在屏幕可视区域

4. 执行操作 (act) — 用自然语言描述复杂任务,由AI自主拆解执行

5. 断开连接 (disconnect) — 清理会话

关键命令包括:截图 (take_screenshot)、执行动作 (act --prompt)、列出显示器 (list_displays) 等。act 命令支持两种指令模式:具体指令(如"点击左上角红色关闭按钮")和目标驱动指令(如"用Chrome搜索上海天气并返回结果")。

显著优点

  • 零侵入性:无需应用提供API、DOM结构或无障碍标签,任何可见界面均可操作
  • 跨平台统一:同一套命令适用于 macOS/Windows/Linux
  • 自然语言交互:用人类语言描述任务,降低自动化编写门槛
  • 复杂任务自主规划act 命令内置多步推理,自动处理点击、输入、滚动、等待等子操作
  • 多显示器支持:可指定 displayId 切换不同屏幕

潜在缺点与局限性

  • 强依赖视觉模型:必须使用 Gemini-3、Qwen3-VL、Doubao Seed 1.6 等具备强 grounding 能力的多模态模型,配置门槛较高
  • 同步执行强制要求:每个命令必须串行等待完成,无法并行,复杂任务耗时较长(单次命令约1分钟)
  • 截图-分析-行动循环开销:每一步都需要AI推理,高频操作场景效率受限
  • 视觉遮挡敏感:窗口重叠、弹窗拦截、屏幕保护都会导致失败
  • 环境配置复杂:需正确设置 API密钥、模型名称、BASE_URL、FAMILY 四个环境变量

适合人群

  • 需要自动化遗留系统或无API老旧软件的开发者
  • 跨平台RPA(机器人流程自动化)需求场景
  • 快速原型验证、UI测试脚本编写人员
  • 不愿学习复杂自动化框架(如Selenium、PyAutoGUI)的普通用户

常规风险

  • 隐私泄露风险:所有屏幕内容发送至云端多模态模型处理,敏感信息可能被记录
  • 误操作风险:AI可能误判视觉元素位置,导致点击错误按钮或输入至错误区域
  • 成本累积:每次截图和推理都消耗API token,高频使用成本较高
  • 权限要求:macOS需授予终端辅助功能(Accessibility)权限,存在安全边界突破

安全解读

核心用法

Desktop Computer Automation 是一款基于 Midscene.js 的视觉驱动桌面自动化 Skill,允许用户通过自然语言命令控制桌面环境(macOS/Windows/Linux)。其核心工作流程为:

1. 连接桌面: 使用 npx @midscene/computer@1 connect 建立会话
2. 健康检查: 验证截图和鼠标控制功能正常

3. 执行操作: 通过 act 命令使用自然语言描述复杂任务(如"在 Chrome 中搜索上海天气并告诉我结果")

4. 断开连接: 使用 disconnect 结束会话

关键命令包括:

  • take_screenshot - 捕获当前屏幕状态
  • act --prompt "..." - 执行自然语言描述的 UI 操作
  • list_displays - 管理多显示器环境

显著优点

1. 技术无关性: 纯视觉驱动,不依赖 DOM 或无障碍标签,可控制任何可见元素
2. 自然语言交互: 使用自然语言描述复杂任务,AI 自动规划并执行多步骤操作

3. 跨平台支持: 支持 macOS、Windows、Linux 三大桌面系统

4. 来源可信: 基于 web-infra-dev 维护的开源项目 Midscene.js,社区活跃

5. 文档详尽: 提供了完整的最佳实践、故障排除和安全使用指南

潜在缺点与局限性

1. 外部依赖: 必须配置 AI 视觉模型 API(Gemini、Qwen、Doubao 等),产生额外成本和延迟
2. 延迟问题: 典型命令需约 1 分钟,复杂任务可能更久,不适合实时性要求高的场景

3. 权限敏感: 需要授予终端应用辅助功能/无障碍权限,存在潜在安全风险

4. 环境配置复杂: 需正确配置 PATH(尤其 macOS)和多个环境变量

5. 同步执行限制: 必须同步执行命令,无法并行处理多个任务

6. 数据隐私: 屏幕截图需发送至用户指定的 AI 模型服务端

适合人群

  • 自动化测试工程师: 需要跨技术栈的 UI 自动化测试
  • 开发者/DevOps: 需要自动化桌面应用交互流程
  • 无障碍辅助用户: 需要通过自然语言控制计算机的用户
  • 技术支持人员: 需要远程或自动化协助用户操作桌面环境

常规风险

1. API Key 泄露风险: 环境变量中包含敏感 API Key,需妥善保管 .env 文件
2. 权限滥用风险: 桌面控制权限若被恶意利用,可能导致未授权系统操作

3. 数据外传风险: 屏幕截图传输至第三方 AI 服务,需确认服务商隐私政策

4. 版本漂移风险: 使用 @midscene/computer@1 可能自动更新,建议生产环境固定版本

安全使用建议

  • 仅在使用时启用辅助功能权限,完成后及时撤销
  • 将 .env 文件添加到 .gitignore,避免意外提交敏感信息
  • 生产环境建议固定 Midscene 包的特定版本号
  • 明确了解截图数据的处理方式和存储位置

Midscene Automations Skills for Computer 内容

手动下载zip · 4.2 kB
SKILL.mdtext/markdown
请选择文件