核心用法
Desktop Automation Skill 是一款基于 Python 的本地桌面自动化工具,通过 OpenClaw 框架提供标准化接口。核心能力分为三层:
基础控制层:基于 PyAutoGUI 实现鼠标移动/点击、键盘输入、滚轮操作、剪贴板交互,支持精确的坐标定位或相对位移。
视觉识别层:集成 OpenCV 进行模板匹配图像定位(find_image),支持置信度阈值调节;通过 Tesseract OCR 实现屏幕文字识别(find_text_on_screen),需额外安装系统级引擎。
窗口管理层:跨平台获取窗口列表、激活指定窗口、监听窗口变化,解决多应用协同场景下的焦点切换问题。
宏录制回放:内置 Tkinter GUI 工具,可录制完整操作序列(含时序)并保存为 JSON,支持变速回放与批量复用。
显著优点
1. 纯本地执行:零网络依赖,敏感操作(银行、内部系统)无外泄风险
2. 遗留系统兼容:无需 API 即可自动化任何 GUI 应用,填补 RPA 工具覆盖盲区
3. 视觉反馈闭环:图像/OCR 识别替代绝对坐标,适应分辨率/主题变化
4. 开源可扩展:MIT 协议,Python 生态丰富,可深度定制复杂逻辑
潜在局限
- 平台差异:Linux 需额外安装
xclip/python3-tk,macOS 部分功能受限 - OCR 精度依赖:Tesseract 对非标准字体、复杂背景识别率有限
- 无原生并行:宏录制为单线程顺序执行,大规模并发需自行封装
- 权限敏感:Windows UAC 弹窗、macOS 辅助功能权限需手动授权
适合人群
- 运维/测试工程师:批量配置遗留设备、自动化回归测试
- 财务/行政人员:周期性报表填报、跨系统数据搬运
- 开发者:快速原型验证、CI/CD 中的 GUI 自动化阶段
常规风险
- 误操作风险:坐标错误可能导致点击敏感区域,建议先用
screenshot核验 - 故障安全:PyAutoGUI 默认启用 failsafe(移鼠标至角落中断),但长时间自动化仍可能锁死输入
- 图像维护成本:UI 改版后模板匹配失效,需定期更新截图素材