Local Voice (FluidAudio TTS/STT)

🔊 Apple Silicon 本地化语音 AI 引擎

Apple Silicon 本地化语音合成与识别方案,基于 FluidAudio CoreML 模型,通过 Apple Neural Engine 实现亚秒级 TTS/STT,完全离线运行。

收藏
10.6k
安装
2.2k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能

Local Voice 是一款面向 Apple Silicon Mac 的本地化语音 AI 解决方案,整合 FluidAudio 的 CoreML 模型实现高性能文本转语音(TTS)与语音转文本(STT)。该方案通过 HTTP 守护进程提供服务,无需云端依赖,在隐私保护与响应速度方面具有显著优势。

TTS 能力:基于 Kokoro 模型,提供 54 种预设音色,典型延迟 0.6-0.8 秒,支持语速调节(0.5-2.0x)、去齿音处理及基础 SSML 标签。推荐音色包括 af_heart(温暖自然)、af_bella(富有表现力)等。

STT 能力:采用 Parakeet TDT v3 模型,延迟约 0.2-0.3 秒,支持 25 种语言识别,适合实时交互场景。

显著优点

1. 完全本地化:零云端依赖,无 API 费用,离线可用,从根本上消除语音数据外泄风险
2. 硬件加速:深度利用 Apple Neural Engine,能效比优于 CPU 推理方案

3. 亚秒级延迟:首载后响应时间低于 1 秒,显著优于多数云端 TTS 服务

4. 开发者友好:提供简洁 REST API,易于集成至现有语音助手或自动化工作流

潜在局限

  • 平台限制:仅限 macOS 14+ 与 Apple Silicon 设备,x86 架构及旧版本系统不支持
  • 首次冷启动:模型初始加载需 8-10 秒,需合理设计预加载策略
  • 音色定制受限:54 种预设音色无法自定义训练,个性化程度低于部分云端方案
  • SSML 支持有限:仅支持基础标签(phoneme、sub、say-as),复杂场景表现力不足

适用人群

  • 注重隐私的本地 AI 用户(如 StellaScreen 等语音助手开发者)
  • 需要离线语音能力的 macOS 自动化工作流构建者
  • 希望替代 Azure/ AWS/ Google 云 TTS 以降低成本的企业开发者
  • Apple 生态深度用户,追求端侧 AI 体验

常规风险

1. 构建复杂度:需 Swift 工具链、espeak-ng 依赖及手动处理动态库路径,对非开发者门槛较高
2. 守护进程稳定性:LaunchAgent 配置不当可能导致服务异常退出,需监控日志输出

3. 模型更新维护:CoreML 模型需跟随 FluidAudio 上游更新,存在兼容性维护成本

4. 资源占用:Neural Engine 推理虽高效,但多并发场景下可能与其他 ML 任务竞争算力

Local Voice (FluidAudio TTS/STT) 内容

references文件夹
scripts文件夹
sources文件夹
Sources文件夹
StellaVoice文件夹
手动下载zip · 7.8 kB
VOICES.mdtext/markdown
请选择文件