Give eyes to your openclaw

👁 AI 视角,看见你的屏幕

让 AI 看见你的屏幕——本地截屏、录屏、语音捕获与视觉分析,数据零上传,隐私优先的屏幕感知 MCP 工具

收藏
2.3k
安装
1.1k
版本
1.0.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Eye2byte 是一个开源 MCP 服务器,赋予 AI Agent「视觉能力」。通过 capture_and_summarizecapture_with_voicerecord_clip_and_summarize 等工具,AI 可以主动捕获用户屏幕截图、录制短片段、同步语音描述,并返回结构化的 Context Pack(包含目标、环境、屏幕状态、错误信号、情境推断和建议)。

关键工具

  • capture_and_summarize:全屏/窗口/区域截图,支持多显示器(monitor=-1 捕获全部屏幕)
  • capture_with_voice:截图+语音同步,适合口述问题场景
  • record_clip_and_summarize:录屏提取关键帧,用于分析动态流程
  • summarize_screenshot:分析已有图片文件
  • transcribe_audio:本地 Whisper 语音转文字
  • get_recent_context:召回历史捕获记录

显著优点

  • 完全本地化:所有数据存储在 ~/.eye2byte/output/,7 天自动清理,零云端上传
  • 零遥测:不收集任何分析数据
  • 灵活捕获:支持延迟捕获、窗口名定位、多显示器管理
  • 结构化输出:Context Pack 标准化视觉信息,降低沟通成本
  • 远程支持:SSE 模式允许跨机器连接(需 token 认证)

潜在局限

  • 依赖本地环境:需 Python + ffmpeg,Windows/macOS/Linux 兼容性需实测
  • vision model 依赖:图像分析依赖用户配置的第三方 API(如 GPT-4V)
  • 权限要求:录屏/截图需系统级权限,部分企业环境受限
  • token 管理:远程模式需用户妥善保管 EYE2BYTE_MCP_TOKEN

适合人群

  • 需要 AI 协助调试 UI 问题、代码报错、终端输出的开发者
  • 希望通过语音+屏幕快速描述复杂场景的产品/设计师
  • 追求数据隐私、拒绝云端截图服务的敏感行业用户

常规风险

  • 本地文件安全:捕获文件明文存储,多用户共享机器需注意权限
  • API 密钥暴露:若配置 vision model,需确保密钥安全
  • 误捕获敏感信息:建议用户延迟捕获或手动清理含密码/隐私的截图
  • SSE 传输安全:远程模式建议配合 VPN 或 TLS 代理,避免 token 嗅探

Give eyes to your openclaw 内容

手动下载zip · 3.6 kB
skill-card.mdtext/markdown
请选择文件