Her Voice

🎙️ 本地 AI 语音引擎,零延迟自然发声

Her Voice 是一款基于本地 Kokoro TTS 引擎的语音合成技能,支持实时流式播放、声线混合、可视化特效,无需 API 密钥即可为 AI Agent 赋予自然人声。

收藏
3.5k
安装
1.2k
版本
1.0.2
CLS 安全性认证2026-08-03
点击查看完整报告 >

使用说明

Her Voice 是一套完整的本地文本转语音(TTS)解决方案,专为希望让 AI Agent 具备语音能力的用户设计。核心引擎采用 Kokoro 82M 模型,通过 MLX(Apple Silicon 原生加速)或 PyTorch(跨平台)双后端运行,实现完全离线、零 API 费用的语音合成。

核心用法

基础语音输出:安装后通过 speak.py "文本" 即可发声,支持管道输入、文件保存、声速调节等常用功能。流式体验:采用即时生成即时播放技术,配合常驻内存的 TTS Daemon,首响延迟可低至 0.3 秒,远快于传统的批量生成模式。声线定制:除预设语音外,支持通过 voice_blend 配置混合多种声线,创造独特角色音色。可视化特效(macOS 独占):60fps 浮动 LED 条实时响应音频,支持拖拽播放、剪贴板粘贴朗读等交互模式。通知音效:调用系统音效在 TTS 生成前播放,提供即时反馈,消除"静默等待"焦虑。

显著优点

1. 完全本地化:无需网络连接、无 API 密钥、无订阅费用,隐私数据不出设备
2. 极低延迟:Daemon 常驻内存 + 流式架构,响应速度接近实时对话

3. 高度可配置:从声线混合、语速、通知音效到可视化主题均可自定义

4. 跨平台兼容:MLX 后端在 Apple Silicon 上性能最优,PyTorch 后端覆盖 Linux 及 Intel Mac

5. 工程细节完善:自动检测 Daemon、错误提示详尽、支持非英语姓名注音(user_name_tts

潜在局限

  • 平台限制:可视化组件与通知音效仅支持 macOS,Windows 完全不支持
  • 资源占用:Daemon 常驻需约 2.3GB 内存,低端设备可能吃力
  • 首次配置复杂:需安装 Xcode 工具链、espeak-ng、多虚拟环境,对非技术用户门槛较高
  • 声线质量依赖模型:Kokoro 虽轻量(82M),但情感表现力仍逊于云端大模型(如 ElevenLabs)
  • 中文支持存疑:文档未明确提及中文 TTS 能力,Kokoro 训练数据以英语为主

适合人群

  • Apple Silicon Mac 用户追求极致本地语音体验
  • 对隐私敏感、拒绝云端 TTS 服务的开发者
  • 需要为 AI Agent 打造专属角色音色的创意项目
  • 具备命令行操作能力、能独立解决环境配置问题的技术用户

常规风险

  • 内存泄漏风险:Daemon 长期运行可能累积内存碎片,建议定期重启
  • 音频权限问题:macOS 可能阻止音频输出,需在系统设置中手动授权
  • 模型文件完整性:下载中断或磁盘空间不足可能导致模型损坏,需重新运行 setup
  • 版本漂移:PyTorch/MLX 后端与模型版本不匹配时可能产生静默错误或音质下降
  • 非英语发音:非英语姓名需手动配置 phonetic spelling,否则可能出现尴尬误读

安全解读

核心用法

Her Voice 是一款专为 AI Agent 打造的本地文本转语音(TTS)技能,让用户输入的文字瞬间转化为自然流畅的语音播报。使用时,Agent 检测到用户语音请求后,调用 speak.py 脚本传入文本即可完成播报;若追求极速响应,可预先启动 TTS Daemon 将模型常驻内存,消除每次约 1.1 秒的冷启动延迟。macOS 用户还能享受专属的实时可视化浮窗,60fps LED 条形图随语音律动,支持拖拽音频、粘贴文本等交互模式。

安装流程通过 setup.py 一键完成:自动识别平台(Apple Silicon 启用 MLX 引擎,其他平台回退 PyTorch)、安装 espeak-ng 音素器、下载 Kokoro-82M 模型、编译原生可视化组件。配置层面支持语音混合(Voice Blending)、语速调节、发音人选择,还能为英文名设置音标拼写以优化非英语名称的朗读效果。

显著优点

极致隐私安全:100% 离线运行,零外部 API 调用,用户文本与生成音频全程不出本机,彻底杜绝数据泄露风险。配置文件与模型均存储于本地 ~/.her-voice/,权限严格限制为仅所有者可访问。

超低延迟体验:流式生成技术让音频边合成边播放,配合 Daemon 模式首句响应仅约 0.3 秒,远优于传统批处理方案。通知音效(如 macOS 系统音「Blow」)在 TTS 生成前即时播放,消除用户等待焦虑。

跨平台灵活适配:Apple Silicon 享原生 Metal 加速(MLX 框架),Linux 与 Intel Mac 通过 PyTorch 无缝运行,代码层面自动检测最优引擎,无需用户手动切换。

高度可定制:从语音音色混合、语速倍率到可视化风格(v2/经典模式),再到通知音效开关,几乎所有环节均可通过 JSON 配置或命令行参数微调,满足个性化需求。

潜在缺点与局限性

平台限制明显:可视化组件与 MLX 加速为 macOS 独占,Windows 完全不支持,Linux 用户无缘可视化浮窗,体验存在落差。

资源占用较高:Daemon 模式虽快,但常驻内存约 2.3GB,对于内存紧张设备或低频使用场景反而造成浪费;且守护进程无法自启动,每次系统重启后需手动重新拉起。

初始设置门槛:依赖 Python 3、espeak-ng 及 Xcode 命令行工具(macOS),setup 脚本涉及多源下载(PyPI、Hugging Face),网络环境不佳时可能中断,且模型文件暂无内置完整性校验。

语音内容风险:TTS 会忠实朗读任何输入文本,若不慎将密码、密钥等敏感信息传入,可能通过扬声器泄露;多人办公场景下的语音播报也存在隐私暴露隐患。

适合的目标群体

  • 隐私敏感型用户:对云端 TTS 服务存疑,要求数据绝对本地化处理的个人或企业;
  • macOS Apple Silicon 用户:追求极致性能与原生可视化体验的设备持有者;
  • AI Agent 开发者:希望为自建 Agent 快速添加语音交互能力,不愿接入付费 API 的技术团队;
  • 无障碍需求用户:需要文本朗读辅助的视障或阅读障碍人士,可搭配持续运行模式作为语音工作站。

使用风险

依赖安全风险:setup.py 从 PyPI 和 Hugging Face 拉取第三方包,虽经安全扫描无已知恶意依赖,但供应链攻击理论上存在可能,建议在可信网络环境执行安装并关注上游安全通告。

资源管理风险:Daemon 常驻内存可能导致系统内存压力,长时间不调用时仍占用资源;突然断电或崩溃可能遗留 PID 文件,需手动清理。

语音合成误用:缺乏输入内容过滤机制,恶意或误操作输入的敏感信息将被直接朗读,建议在上游 Agent 逻辑中增加敏感信息检测拦截。

平台兼容性风险:Linux 用户需自行确保 espeak-ng 可用,Intel Mac 性能受限,跨平台部署前需充分测试目标环境。

Her Voice 内容

assets文件夹
scripts文件夹
手动下载zip · 29.5 kB
HerVoice.swifttext/plain
请选择文件