核心用法
Screen Narrator 是一款基于 Gemini 多模态视觉能力与 ElevenLabs 语音合成技术的 macOS 实时屏幕解说工具。用户启动后,系统持续捕获屏幕画面,由 Gemini-vision 模型生成情境化解说词,再通过 ElevenLabs TTS 输出为自然语音。支持 7 种预设解说风格(sports、nature、horror、noir、reality_tv、asmr、wrestling),并可启用双轨解说模式。
运行时通过 tmux 守护会话维持后台运行,用户可通过向 /tmp/narrator-ctl.json 写入 JSON 指令实现动态控制:切换风格、调节脏话等级、暂停/恢复/停止。状态信息实时写入 /tmp/narrator-status.json 供外部查询。
显著优点
- 多模态 AI 驱动:Gemini-vision 具备强视觉理解能力,解说内容贴合屏幕实际情境,非模板化。
- 高保真语音:ElevenLabs 提供接近真人的语音合成,支持自定义 Voice ID。
- 实时可配置:无需重启即可切换解说风格与参数,适合直播、演示等场景。
- 风格多样化:从体育赛事到 ASMR 耳语,覆盖多种内容创作用例。
潜在局限
- 平台限制:仅支持 macOS,依赖系统级屏幕捕获与音频架构。
- 双 API 依赖:需同时持有 Gemini 与 ElevenLabs 有效 API 密钥,成本叠加。
- 网络延迟:视觉推理与语音合成均依赖云端 API,弱网环境下可能出现解说滞后。
- 隐私风险:持续屏幕捕获可能意外摄入敏感信息(通知、密码输入等),需手动排除隐私区域。
适合人群
- 内容创作者(游戏直播、教程录制、Reaction 视频)
- 无障碍辅助需求用户(视障人士实时场景描述)
- 开发者与极客(AI 工作流实验、多模态应用原型验证)
常规风险
- API 密钥泄露:环境变量存储于用户 shell 配置,多用户系统存在横向读取风险。
- 敏感数据外泄:屏幕画面持续上传至 Google Gemini 服务,需确认企业合规政策。
- 语音合成滥用:ElevenLabs 服务存在合成内容政策限制,违规使用可能导致账号封禁。
- 资源占用:tmux + Python 常驻进程 + 屏幕捕获对旧款 Mac 有一定性能压力。