核心用法
Desktop Automation Skill v2.0 是一款基于 Python/pyautogui 的跨平台桌面自动化工具,支持 Windows/macOS/Linux 三大系统。核心功能涵盖:
键鼠自动化:模拟点击、拖拽、滚动、键盘输入,支持自定义间隔与按键组合;视觉识别:集成 OpenCV 模板匹配实现图像定位,支持多尺度检测;OCR 文本提取:基于 Tesseract 识别屏幕文字,支持多语言(默认法语 fra);宏录制与回放:自动记录用户操作序列,支持鼠标移动防抖压缩,JSON 格式存储;窗口管理:获取/激活窗口、枚举窗口列表;剪贴板操作:读写剪贴板内容。
使用流程:安装依赖 → 放置技能目录 → 重启 OpenClaw → 通过 YAML 调用各项 action,所有操作均支持 dry_run=true 预演测试。
显著优点
1. 零 API 依赖:直接操控系统输入层,无需目标应用开放接口,普适性极强
2. 安全设计完善:默认开启 safe mode,拦截 rm/sudo/系统目录等危险操作;全量审计日志;干运行模式杜绝误操作
3. 跨平台一致:同一套 YAML 语法通吃三大桌面系统
4. 宏智能优化:鼠标移动防抖机制显著压缩宏体积,保留关键节点
5. 扩展性佳:模块化架构(actions/image_recognition/ocr_engine/macro_player/safety_manager),便于二次开发
潜在缺点与局限性
- OCR 质量依赖环境:Tesseract 安装复杂,识别准确率受字体、对比度、分辨率影响
- 图像识别 fragile:模板匹配对 UI 变化敏感,分辨率/主题更换可能导致定位失败
- 无原生应用感知:基于坐标和像素的自动化,无法像 Accessibility API 那样理解控件语义
- 性能瓶颈:纯 Python + 截图轮询,高频场景 CPU 占用较高
- 宏可移植性差:绝对坐标录制在不同分辨率设备间无法通用
适合人群
- 需要批量处理重复性桌面操作的技术人员(数据录入、表单填写、测试人员)
- 无编程 API 的老旧系统自动化改造
- 个人效率工具爱好者,愿意接受一定的维护成本
常规风险
| 风险类型 | 说明 | 缓解措施 |
|---------|------|---------|
| 隐私泄露 | 全键鼠事件捕获可能记录密码/敏感信息 | 明确警告用户录制时避开敏感输入,宏文件加密存储 |
| 误操作破坏 | 自动化执行系统命令或删除文件 | safe mode 默认拦截危险模式,dry_run 强制测试 |
| 依赖漏洞 | pyautogui/OpenCV/Tesseract 供应链风险 | 定期更新依赖,隔离运行环境 |
| 权限提升 | 需系统级输入权限,可能被恶意利用 | 最小权限原则,审计日志全量留存 |
| 宏注入攻击 | 篡改 JSON 宏文件植入恶意操作 | 宏文件完整性校验,来源白名单 |