Screen Vision

👁️ 屏幕文字识别与自动点击终端神器

基于 Apple Vision 框架的 macOS 屏幕 OCR 与点击自动化 CLI,支持终端内识别屏幕文字并执行自动点击,适用于无 API 的传统应用自动化。

收藏
6.6k
安装
1.7k
版本
1.2.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能

screen-vision 是一款面向 macOS 的屏幕 OCR 与自动化 CLI 工具,深度集成 Apple Vision 框架与 ScreenCaptureKit,实现从终端直接捕获屏幕任意区域、提取文字坐标并执行点击操作的全流程自动化。

显著优点

1. 原生性能:Apple Vision 提供设备端 OCR,无需网络请求,响应速度快且隐私安全
2. 语义化点击:支持通过文字内容定位并点击(tap "OK"),解决无 API 应用(如银行软件、旧版企业系统)的自动化难题

3. 灵活捕获:支持全屏、指定应用窗口或自定义区域 (--region) 三级优先级

4. 实用模式wait 轮询等待、has 条件判断、retry 重试机制,满足 CI/CD 与自动化测试场景

5. 结构化输出:JSON 格式输出含坐标、置信度,便于管道处理(配合 jq

局限与风险

  • macOS 14+ 独占:依赖 Apple Vision 最新 API,旧系统无法运行
  • 权限门槛:需用户手动授权「屏幕录制」权限,首次使用有交互中断
  • 视觉依赖:UI 变动导致坐标失效,需配合 --retry 增强健壮性
  • OCR 精度边界:低对比度、极小字体、复杂排版可能出现识别偏差
  • 自动化伦理风险:可点击任意屏幕元素,需警惕恶意脚本滥用(如自动确认敏感操作)

适合人群

  • 自动化测试工程师(测试无 API 的桌面应用)
  • 运维/DevOps 需自动化 macOS 遗留系统交互
  • 无障碍辅助工具开发者
  • 个人效率极客构建自定义工作流

常规风险

  • 脚本错误可能导致误点击敏感区域(建议在非生产环境充分测试)
  • 高频 OCR 可能短暂占用 CPU/GPU 资源
  • 坐标系依赖屏幕分辨率与缩放设置,多显示器场景需验证

Screen Vision 内容

手动下载zip · 3.7 kB
setup.shtext/x-shellscript
请选择文件