Her Voice

🎙️ 本地 AI 语音,即时自然发声

基于 Kokoro TTS 的本地语音合成技能,零延迟流式播放,无需 API 密钥,支持 Apple Silicon 原生加速与实时可视化效果,为智能体赋予自然人声。

收藏
2.4k
安装
1.2k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Her Voice 是一款基于 Kokoro TTS 模型的本地语音合成技能,旨在为 AI 智能体赋予自然、富有表现力的人声。用户可通过简单的 Python 脚本调用 speak.py 实现文本转语音,支持流式播放、音频保存、语速/音色调节等功能。首次运行需执行 setup.py 完成环境配置,包括自动检测平台(Apple Silicon 优先使用 MLX 引擎,其他平台使用 PyTorch)、安装依赖(espeak-ng)、下载模型等。

核心工作流为:检查语音模式 → 播放通知音(即时反馈)→ 调用 TTS 生成语音 → 同时输出文本确保可访问性。高级功能包括 TTS Daemon(常驻内存模型,节省 ~1.1 秒启动时间,占用 ~2.3GB RAM)、Persist Mode(可视化悬浮窗持续运行,支持拖拽音频、粘贴文本朗读),以及 60fps 实时音频可视化器(macOS 专属,Cocoa/AVFoundation 原生实现)。

显著优点

1. 完全本地化,零隐私风险:模型运行于本地设备,无需云端 API 或订阅服务,杜绝数据外传。
2. 极低延迟:流式生成技术实现 "边说边播",配合 Daemon 模式下首音响应约 0.3 秒,体验接近真人对话。

3. Apple Silicon 深度优化:MLX 框架原生调用 Metal GPU,性能显著优于通用 PyTorch 后端。

4. 高度可配置:支持音色混合(voice blending)、语速调节、自定义通知音效、可视化器动画模式等。

5. 开源生态:基于 Kokoro-82M 开源模型,社区活跃,无商业锁定。

潜在局限

1. 平台功能差异:实时可视化器仅限 macOS,Linux/Intel Mac 用户无法获得完整视觉体验。
2. 硬件资源消耗:Daemon 模式需常驻 ~2.3GB RAM,对内存受限设备不够友好。

3. 依赖复杂度:需安装 espeak-ng、Xcode 命令行工具(macOS 可视化器编译),首次配置步骤较多。

4. 音色质量参差:官方文档坦诚标注了各音质的等级(如男声 am_michael 仅评 C+),非英语姓名需手动标注音标。

5. Daemon 非持久化:重启后需手动重新启动 Daemon,未实现系统服务化。

适合人群

  • Apple Silicon Mac 用户:能充分发挥 MLX 加速与可视化器的完整功能。
  • 隐私敏感型开发者:拒绝云端 TTS 的数据外泄风险。
  • 低延迟交互场景:如 AI 助手、实时播报、无障碍阅读工具。
  • 技术爱好者:愿意投入初期配置时间,换取长期免费、可控的语音能力。

常规风险

  • 配置失败风险:依赖 espeak-ng 和 Python 虚拟环境,跨版本或路径问题可能导致 TTS 引擎无法启动。
  • 资源泄露风险:Daemon 异常退出时可能遗留 /tmp 下的 socket 文件,需手动清理。
  • 音频权限问题:macOS 需确保输出设备权限正常,否则出现无声故障。
  • 模型偏见风险:Kokoro 作为神经网络模型,训练数据可能隐含性别、口音偏见,音色评分体系也反映了开发者的主观偏好。

Her Voice 内容

assets文件夹
scripts文件夹
手动下载zip · 25.3 kB
HerVoice.swifttext/plain
请选择文件