核心功能
screen-vision 是一款面向 macOS 的屏幕 OCR 与自动化 CLI 工具,深度集成 Apple Vision 框架与 ScreenCaptureKit,实现从终端直接捕获屏幕任意区域、提取文字坐标并执行点击操作的全流程自动化。
显著优点
1. 原生性能:Apple Vision 提供设备端 OCR,无需网络请求,响应速度快且隐私安全
2. 语义化点击:支持通过文字内容定位并点击(tap "OK"),解决无 API 应用(如银行软件、旧版企业系统)的自动化难题
3. 灵活捕获:支持全屏、指定应用窗口或自定义区域 (--region) 三级优先级
4. 实用模式:wait 轮询等待、has 条件判断、retry 重试机制,满足 CI/CD 与自动化测试场景
5. 结构化输出:JSON 格式输出含坐标、置信度,便于管道处理(配合 jq)
局限与风险
- macOS 14+ 独占:依赖 Apple Vision 最新 API,旧系统无法运行
- 权限门槛:需用户手动授权「屏幕录制」权限,首次使用有交互中断
- 视觉依赖:UI 变动导致坐标失效,需配合
--retry增强健壮性 - OCR 精度边界:低对比度、极小字体、复杂排版可能出现识别偏差
- 自动化伦理风险:可点击任意屏幕元素,需警惕恶意脚本滥用(如自动确认敏感操作)
适合人群
- 自动化测试工程师(测试无 API 的桌面应用)
- 运维/DevOps 需自动化 macOS 遗留系统交互
- 无障碍辅助工具开发者
- 个人效率极客构建自定义工作流
常规风险
- 脚本错误可能导致误点击敏感区域(建议在非生产环境充分测试)
- 高频 OCR 可能短暂占用 CPU/GPU 资源
- 坐标系依赖屏幕分辨率与缩放设置,多显示器场景需验证