核心功能
macos-desktop-control 是一款面向 macOS 的桌面自动化技能,采用「语义控制 + 视觉识别」双轨架构:
- AppleScript 语义层:激活应用、检查运行状态、读取窗口标题与数量
- 视觉识别层:截图后通过 OCR(Apple Vision)或 OpenCV 模板匹配定位 UI 元素
- 操作执行层:基于 pyautogui 实现鼠标移动、点击、拖拽、键盘输入等动作
显著优点
1. 中文友好:专为中文用户优化,文字识别与输入均无兼容性问题
2. 坐标系统智能适配:自动处理 Retina 屏幕的物理像素与逻辑坐标转换,避免点击偏移
3. 设计边界清晰:明确区分 AppleScript(应用语义)与 pyautogui(视觉交互),避免深度 UI 脚本带来的脆弱性
4. 安全机制内置:pyautogui.FAILSAFE = True,鼠标移至左上角可紧急中断自动化
5. 惰性初始化:坐标映射自动完成,无需手动配置
潜在局限
- 当前版本假设单屏幕 Retina 环境,多屏或外接显示器需额外验证
- 依赖屏幕录制与辅助功能权限,首次使用需系统授权
- 视觉识别对动态内容(动画、加载状态)稳定性有限
- 不包含 AppleScript UI 脚本,无法操作标准无障碍树中的深层控件
适用人群
- 需要跨应用自动化工作流的开发者、测试工程师、效率工具爱好者
- 希望用自然语言描述目标位置("点击确认按钮")并结合 AI 理解的进阶用户
常规风险
- 自动化操作可能干扰正常操作,建议在专注模式下运行
- 权限申请涉及屏幕内容访问,需在可信环境使用
- OCR/图像匹配存在误识别可能,关键操作建议配合视觉验证