Local Voice (FluidAudio TTS/STT)

🎙️ Apple 芯片专属,极速离线语音 AI

Apple Silicon 本地语音合成与识别,亚秒级延迟离线运行,替代云端 TTS/STT 服务

收藏
4.6k
安装
2.2k
版本
1.0.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Local Voice 是基于 FluidAudio 的 Apple Silicon 原生语音 AI 解决方案,提供完全离线的文本转语音(TTS)和语音转文本(STT)能力。用户需通过 Homebrew 安装依赖、编译 Swift 守护进程、配置 LaunchAgent 实现后台服务,最终通过本地 HTTP 端点(127.0.0.1:18790)调用 API。

TTS 功能:采用 Kokoro 模型,支持 54 种语音,延迟约 0.6-0.8 秒,提供语速控制(0.5-2.0 倍)、SSML 标记、自动标点语气等功能。STT 功能:基于 Parakeet TDT v3 模型,支持 25 种语言,延迟仅 0.2-0.3 秒。两者均运行于 Apple Neural Engine,无需联网、无 API 费用。

显著优点

  • 隐私安全:100% 本地处理,敏感语音数据不上传云端
  • 极速响应:首次加载后亚秒级合成,STT 延迟低于 300ms
  • 零边际成本:无按量计费,适合高频调用场景
  • 硬件优化:CoreML 模型专为 ANE 优化,能效比优异
  • 开放架构:HTTP API 便于集成至现有语音助手或自动化工作流

潜在局限

  • 平台锁定:仅支持 macOS 14+ 与 Apple Silicon(M1/M2/M3/M4),x86 及非苹果设备无法使用
  • 首次冷启动:模型加载需 8-10 秒,期间体验明显延迟
  • 部署复杂度:需手动编译 Swift 项目、处理动态库路径、配置 LaunchAgent,技术门槛较高
  • 语音定制受限:默认 54 种预设语音,无法像云端服务(如 ElevenLabs)进行精细克隆或风格迁移
  • 依赖维护:espeak-ng 等外部依赖版本更新可能导致兼容性问题

适合人群

  • 重视隐私的开发者与个人用户(医疗、法律等敏感场景)
  • 需要高频语音交互且希望控制成本的 Apple Silicon 用户
  • 构建本地语音助手或智能家居中控的技术爱好者
  • 需要离线语音能力的野外/无网络环境工作者

常规风险

  • 模型偏见:训练数据可能存在语言、性别、口音代表性偏差
  • 误识别风险:STT 在嘈杂环境或专业术语场景下准确率下降
  • 系统资源占用:持续后台运行消耗内存与 ANE 算力,可能影响其他机器学习任务
  • 供应链风险:FluidAudio/CoreML 模型更新依赖第三方维护,长期支持存疑

Local Voice (FluidAudio TTS/STT) 内容

references文件夹
scripts文件夹
sources文件夹
Sources文件夹
StellaVoice文件夹
手动下载zip · 9.0 kB
VOICES.mdtext/markdown
请选择文件