Narrator

🎙️ AI 实时配音你的屏幕生活

AI 实时解说屏幕活动,支持 7 种风格化配音,适合直播、娱乐与创意内容制作

收藏
3.4k
安装
1.5k
版本
1.3.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Screen Narrator 是一款 macOS 专属工具,通过 Gemini Flash 视觉模型实时捕捉屏幕画面,生成风格化解说词,并以 ElevenLabs TTS 实时播报。用户可选择 7 种预设风格——体育解说、自然纪录片、恐怖片、黑色侦探、真人秀、ASMR 耳语、摔跤狂热——每种风格配有独立配音与氛围音轨。

运行命令后,工具进入后台持续截取屏幕,AI 分析画面内容后生成对应风格的台词,通过 WebSocket 流式传输至 ElevenLabs 合成语音,同时播放循环背景音效。双通道管线设计确保短句与长句交替生成,消除播报空档。

显著优点

  • 高度个性化:7 种风格覆盖从娱乐到沉浸的多元场景,支持自定义配音与氛围音
  • 实时交互:运行时可通过 JSON 控制文件动态切换风格、调节脏话等级、暂停/恢复
  • 低延迟流式输出:ElevenLabs WebSocket 实现近乎实时的语音合成
  • 创意内容友好:为直播、录屏、演示增添电影级叙事质感

潜在局限

  • 平台锁定:仅支持 macOS,依赖系统级屏幕录制权限
  • API 成本持续消耗:Gemini Flash 与 ElevenLabs 均按用量计费,长时间运行费用累积
  • 隐私敏感:持续上传屏幕画面至 Google Gemini,涉及敏感信息泄露风险
  • 配置门槛:需手动管理多组 API 密钥、配音 ID 与音频文件格式转换

适合人群

内容创作者、游戏主播、演示设计师、ASMR 爱好者,以及希望为日常电脑使用增添戏剧化叙事的用户。

常规风险

  • 屏幕内容可能包含敏感信息,上传至第三方 AI 服务存在数据主权争议
  • ElevenLabs 账户余额不足将导致语音中断
  • 长时间高频率 API 调用可能触发速率限制或产生意外账单

Narrator 内容

手动下载zip · 6.7 kB
horror_demo.pytext/plain
请选择文件