Narrator

🎙️ AI实时解说你的屏幕

Gemini视觉驱动的实时屏幕解说,支持多种风格(体育、恐怖、ASMR等)与ElevenLabs语音合成,通过JSON文件实现动态控制。

收藏
6.3k
安装
1.5k
版本
1.3.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Screen Narrator 是一款基于 Gemini 多模态视觉能力与 ElevenLabs 语音合成技术的 macOS 实时屏幕解说工具。用户启动后,系统持续捕获屏幕画面,由 Gemini-vision 模型生成情境化解说词,再通过 ElevenLabs TTS 输出为自然语音。支持 7 种预设解说风格(sports、nature、horror、noir、reality_tv、asmr、wrestling),并可启用双轨解说模式。

运行时通过 tmux 守护会话维持后台运行,用户可通过向 /tmp/narrator-ctl.json 写入 JSON 指令实现动态控制:切换风格、调节脏话等级、暂停/恢复/停止。状态信息实时写入 /tmp/narrator-status.json 供外部查询。

显著优点

  • 多模态 AI 驱动:Gemini-vision 具备强视觉理解能力,解说内容贴合屏幕实际情境,非模板化。
  • 高保真语音:ElevenLabs 提供接近真人的语音合成,支持自定义 Voice ID。
  • 实时可配置:无需重启即可切换解说风格与参数,适合直播、演示等场景。
  • 风格多样化:从体育赛事到 ASMR 耳语,覆盖多种内容创作用例。

潜在局限

  • 平台限制:仅支持 macOS,依赖系统级屏幕捕获与音频架构。
  • 双 API 依赖:需同时持有 Gemini 与 ElevenLabs 有效 API 密钥,成本叠加。
  • 网络延迟:视觉推理与语音合成均依赖云端 API,弱网环境下可能出现解说滞后。
  • 隐私风险:持续屏幕捕获可能意外摄入敏感信息(通知、密码输入等),需手动排除隐私区域。

适合人群

  • 内容创作者(游戏直播、教程录制、Reaction 视频)
  • 无障碍辅助需求用户(视障人士实时场景描述)
  • 开发者与极客(AI 工作流实验、多模态应用原型验证)

常规风险

  • API 密钥泄露:环境变量存储于用户 shell 配置,多用户系统存在横向读取风险。
  • 敏感数据外泄:屏幕画面持续上传至 Google Gemini 服务,需确认企业合规政策。
  • 语音合成滥用:ElevenLabs 服务存在合成内容政策限制,违规使用可能导致账号封禁。
  • 资源占用:tmux + Python 常驻进程 + 屏幕捕获对旧款 Mac 有一定性能压力。

Narrator 内容

手动下载zip · 6.3 kB
horror_demo.pytext/plain
请选择文件