Her Voice 是一套完整的本地文本转语音(TTS)解决方案,专为希望让 AI Agent 具备语音能力的用户设计。核心引擎采用 Kokoro 82M 模型,通过 MLX(Apple Silicon 原生加速)或 PyTorch(跨平台)双后端运行,实现完全离线、零 API 费用的语音合成。
核心用法
基础语音输出:安装后通过 speak.py "文本" 即可发声,支持管道输入、文件保存、声速调节等常用功能。流式体验:采用即时生成即时播放技术,配合常驻内存的 TTS Daemon,首响延迟可低至 0.3 秒,远快于传统的批量生成模式。声线定制:除预设语音外,支持通过 voice_blend 配置混合多种声线,创造独特角色音色。可视化特效(macOS 独占):60fps 浮动 LED 条实时响应音频,支持拖拽播放、剪贴板粘贴朗读等交互模式。通知音效:调用系统音效在 TTS 生成前播放,提供即时反馈,消除"静默等待"焦虑。
显著优点
1. 完全本地化:无需网络连接、无 API 密钥、无订阅费用,隐私数据不出设备
2. 极低延迟:Daemon 常驻内存 + 流式架构,响应速度接近实时对话
3. 高度可配置:从声线混合、语速、通知音效到可视化主题均可自定义
4. 跨平台兼容:MLX 后端在 Apple Silicon 上性能最优,PyTorch 后端覆盖 Linux 及 Intel Mac
5. 工程细节完善:自动检测 Daemon、错误提示详尽、支持非英语姓名注音(user_name_tts)
潜在局限
- 平台限制:可视化组件与通知音效仅支持 macOS,Windows 完全不支持
- 资源占用:Daemon 常驻需约 2.3GB 内存,低端设备可能吃力
- 首次配置复杂:需安装 Xcode 工具链、espeak-ng、多虚拟环境,对非技术用户门槛较高
- 声线质量依赖模型:Kokoro 虽轻量(82M),但情感表现力仍逊于云端大模型(如 ElevenLabs)
- 中文支持存疑:文档未明确提及中文 TTS 能力,Kokoro 训练数据以英语为主
适合人群
- Apple Silicon Mac 用户追求极致本地语音体验
- 对隐私敏感、拒绝云端 TTS 服务的开发者
- 需要为 AI Agent 打造专属角色音色的创意项目
- 具备命令行操作能力、能独立解决环境配置问题的技术用户
常规风险
- 内存泄漏风险:Daemon 长期运行可能累积内存碎片,建议定期重启
- 音频权限问题:macOS 可能阻止音频输出,需在系统设置中手动授权
- 模型文件完整性:下载中断或磁盘空间不足可能导致模型损坏,需重新运行 setup
- 版本漂移:PyTorch/MLX 后端与模型版本不匹配时可能产生静默错误或音质下降
- 非英语发音:非英语姓名需手动配置 phonetic spelling,否则可能出现尴尬误读