desktop-automation-100per100-local

🖱️ 零 API 跨平台桌面自动化引擎

跨平台桌面自动化技能,支持鼠标键盘模拟、屏幕截图、OCR文字识别和宏录制回放,内置多重安全防护机制。

收藏
3.2k
安装
1.1k
版本
2.0.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

Desktop Automation Skill v2.0 综合评估

核心用法

Desktop Automation Skill 是一款面向 Windows/macOS/Linux 的完整桌面自动化解决方案,无需依赖目标应用的 API 即可实现全系统级操作。核心功能涵盖三大模块:

输入模拟层:通过 pyautogui 实现鼠标点击、移动、拖拽、滚轮及键盘输入(click, type, press_key, drag, scroll),支持自定义按键间隔和动画时长,模拟人类操作轨迹。

视觉感知层:集成 OpenCV 进行模板匹配图像识别(find_image, find_image_multiscale, wait_for_image),以及 Tesseract OCR 引擎实现屏幕文字提取(read_text_ocr, find_text_on_screen, extract_screen_data),支持多语言识别。

流程编排层:提供宏录制回放系统(play_macro),采用 JSON 格式存储事件序列,内置鼠标移动去抖(debouncing)算法优化宏体积;支持子宏调用和播放速度调节。

显著优点

1. 零侵入架构:不依赖任何应用 API,纯系统级模拟,兼容几乎所有桌面软件
2. 生产级安全设计:默认开启 Safe Mode,自动拦截含 rm sudoC:\Windows\ 等危险模式的操作;所有动作支持 dry_run 预演模式;完整审计日志追踪

3. 跨平台一致性:统一 YAML/JSON 接口封装底层差异,Windows/macOS/Linux 行为一致

4. 视觉自动化能力:结合图像识别与 OCR,可处理非标准化 UI、游戏、老旧系统等难以 API 化的场景

5. 线程安全:全模块使用锁机制防止竞态条件

潜在缺点与局限性

  • 依赖外部二进制:OCR 功能需手动安装 Tesseract,图像识别依赖 OpenCV,环境配置门槛较高
  • 分辨率敏感性:模板匹配对屏幕分辨率、缩放比例变化敏感,需使用多尺度检测或维护多套模板
  • 性能开销:屏幕截图和 OCR 属于 CPU 密集型操作,高频调用时延迟明显
  • UI 变动脆弱性:基于像素的自动化对界面改版极度敏感,维护成本随应用更新频率上升
  • 安全悖论:虽然内置 Safe Mode,但用户可显式关闭,且键盘记录能力本身构成潜在攻击面

适合人群

  • RPA 开发者:需要自动化遗留系统或缺乏 API 的企业软件
  • QA 工程师:构建跨平台 UI 自动化测试套件
  • 游戏脚本爱好者:像素级游戏自动化(需遵守 EULA)
  • 效率极客:个人工作流宏编排,如批量数据处理、跨应用信息流转
  • 无障碍辅助:为操作受限用户创建自定义交互方案

常规风险

| 风险类型 | 具体表现 | 缓解措施 |
|---------|---------|---------|
| 凭证泄露 | 录制时意外捕获密码输入 | 强制警告+安全模式默认阻断 |
| 误操作破坏 | 宏执行删除命令、修改系统配置 | Dangerous pattern 扫描+dry_run 强制测试 |
| 恶意宏传播 | JSON 宏文件被篡改植入危险指令 | 文件完整性校验+来源审查 |
| 隐私侵犯 | 全程键鼠记录能力被滥用 | 审计日志+最小权限原则 |
| 系统稳定性 | 高频自动化导致目标应用无响应 | 间隔参数可调+故障安全(failsafe)机制 |

该技能定位明确——在可控风险下填补 API 空白场景的自动化需求,技术实现成熟,但需使用者具备足够的安全意识与测试纪律。

desktop-automation-100per100-local 内容

lib文件夹
scripts文件夹
手动下载zip · 56.6 kB
__init__.pytext/plain
请选择文件