核心用法
Screen Narrator 是一款 macOS 专属工具,通过 Gemini Flash 视觉模型实时捕捉屏幕画面,生成风格化解说词,并以 ElevenLabs TTS 实时播报。用户可选择 7 种预设风格——体育解说、自然纪录片、恐怖片、黑色侦探、真人秀、ASMR 耳语、摔跤狂热——每种风格配有独立配音与氛围音轨。
运行命令后,工具进入后台持续截取屏幕,AI 分析画面内容后生成对应风格的台词,通过 WebSocket 流式传输至 ElevenLabs 合成语音,同时播放循环背景音效。双通道管线设计确保短句与长句交替生成,消除播报空档。
显著优点
- 高度个性化:7 种风格覆盖从娱乐到沉浸的多元场景,支持自定义配音与氛围音
- 实时交互:运行时可通过 JSON 控制文件动态切换风格、调节脏话等级、暂停/恢复
- 低延迟流式输出:ElevenLabs WebSocket 实现近乎实时的语音合成
- 创意内容友好:为直播、录屏、演示增添电影级叙事质感
潜在局限
- 平台锁定:仅支持 macOS,依赖系统级屏幕录制权限
- API 成本持续消耗:Gemini Flash 与 ElevenLabs 均按用量计费,长时间运行费用累积
- 隐私敏感:持续上传屏幕画面至 Google Gemini,涉及敏感信息泄露风险
- 配置门槛:需手动管理多组 API 密钥、配音 ID 与音频文件格式转换
适合人群
内容创作者、游戏主播、演示设计师、ASMR 爱好者,以及希望为日常电脑使用增添戏剧化叙事的用户。
常规风险
- 屏幕内容可能包含敏感信息,上传至第三方 AI 服务存在数据主权争议
- ElevenLabs 账户余额不足将导致语音中断
- 长时间高频率 API 调用可能触发速率限制或产生意外账单