核心用法
Eye2byte 是一个开源 MCP 服务器,赋予 AI Agent「视觉能力」。通过 capture_and_summarize、capture_with_voice、record_clip_and_summarize 等工具,AI 可以主动捕获用户屏幕截图、录制短片段、同步语音描述,并返回结构化的 Context Pack(包含目标、环境、屏幕状态、错误信号、情境推断和建议)。
关键工具
- capture_and_summarize:全屏/窗口/区域截图,支持多显示器(
monitor=-1捕获全部屏幕) - capture_with_voice:截图+语音同步,适合口述问题场景
- record_clip_and_summarize:录屏提取关键帧,用于分析动态流程
- summarize_screenshot:分析已有图片文件
- transcribe_audio:本地 Whisper 语音转文字
- get_recent_context:召回历史捕获记录
显著优点
- 完全本地化:所有数据存储在
~/.eye2byte/output/,7 天自动清理,零云端上传 - 零遥测:不收集任何分析数据
- 灵活捕获:支持延迟捕获、窗口名定位、多显示器管理
- 结构化输出:Context Pack 标准化视觉信息,降低沟通成本
- 远程支持:SSE 模式允许跨机器连接(需 token 认证)
潜在局限
- 依赖本地环境:需 Python + ffmpeg,Windows/macOS/Linux 兼容性需实测
- vision model 依赖:图像分析依赖用户配置的第三方 API(如 GPT-4V)
- 权限要求:录屏/截图需系统级权限,部分企业环境受限
- token 管理:远程模式需用户妥善保管
EYE2BYTE_MCP_TOKEN
适合人群
- 需要 AI 协助调试 UI 问题、代码报错、终端输出的开发者
- 希望通过语音+屏幕快速描述复杂场景的产品/设计师
- 追求数据隐私、拒绝云端截图服务的敏感行业用户
常规风险
- 本地文件安全:捕获文件明文存储,多用户共享机器需注意权限
- API 密钥暴露:若配置 vision model,需确保密钥安全
- 误捕获敏感信息:建议用户延迟捕获或手动清理含密码/隐私的截图
- SSE 传输安全:远程模式建议配合 VPN 或 TLS 代理,避免 token 嗅探