Local Voice (FluidAudio TTS/STT)

🎙️ Apple 芯片专属,极速离线语音 AI

Apple Silicon 本地语音合成与识别,亚秒级延迟离线运行,替代云端 TTS/STT 服务

收藏
4.6k
安装
2.2k
版本
1.0.1
CLS 安全性认证2026-08-11
点击查看完整报告 >

使用说明

核心用法

Local Voice 是基于 FluidAudio 的 Apple Silicon 原生语音 AI 解决方案,提供完全离线的文本转语音(TTS)和语音转文本(STT)能力。用户需通过 Homebrew 安装依赖、编译 Swift 守护进程、配置 LaunchAgent 实现后台服务,最终通过本地 HTTP 端点(127.0.0.1:18790)调用 API。

TTS 功能:采用 Kokoro 模型,支持 54 种语音,延迟约 0.6-0.8 秒,提供语速控制(0.5-2.0 倍)、SSML 标记、自动标点语气等功能。STT 功能:基于 Parakeet TDT v3 模型,支持 25 种语言,延迟仅 0.2-0.3 秒。两者均运行于 Apple Neural Engine,无需联网、无 API 费用。

显著优点

  • 隐私安全:100% 本地处理,敏感语音数据不上传云端
  • 极速响应:首次加载后亚秒级合成,STT 延迟低于 300ms
  • 零边际成本:无按量计费,适合高频调用场景
  • 硬件优化:CoreML 模型专为 ANE 优化,能效比优异
  • 开放架构:HTTP API 便于集成至现有语音助手或自动化工作流

潜在局限

  • 平台锁定:仅支持 macOS 14+ 与 Apple Silicon(M1/M2/M3/M4),x86 及非苹果设备无法使用
  • 首次冷启动:模型加载需 8-10 秒,期间体验明显延迟
  • 部署复杂度:需手动编译 Swift 项目、处理动态库路径、配置 LaunchAgent,技术门槛较高
  • 语音定制受限:默认 54 种预设语音,无法像云端服务(如 ElevenLabs)进行精细克隆或风格迁移
  • 依赖维护:espeak-ng 等外部依赖版本更新可能导致兼容性问题

适合人群

  • 重视隐私的开发者与个人用户(医疗、法律等敏感场景)
  • 需要高频语音交互且希望控制成本的 Apple Silicon 用户
  • 构建本地语音助手或智能家居中控的技术爱好者
  • 需要离线语音能力的野外/无网络环境工作者

常规风险

  • 模型偏见:训练数据可能存在语言、性别、口音代表性偏差
  • 误识别风险:STT 在嘈杂环境或专业术语场景下准确率下降
  • 系统资源占用:持续后台运行消耗内存与 ANE 算力,可能影响其他机器学习任务
  • 供应链风险:FluidAudio/CoreML 模型更新依赖第三方维护,长期支持存疑

安全解读

核心用法

Local Voice 是一个专为 Apple Silicon Mac 设计的本地语音处理 Skill,通过部署 StellaVoice 守护进程,提供 HTTP API 接口实现文本转语音(TTS)和语音转文本(STT)功能。用户需先通过 Homebrew 安装 espeak-ng 依赖,然后使用 Swift 构建守护进程二进制文件,最后配置 LaunchAgent 实现开机自启动。服务启动后监听 127.0.0.1:18790 端口,支持通过 curl 或编程方式调用 /synthesize(TTS)、/transcribe(STT)和 /health(健康检查)端点。

TTS 功能基于 Kokoro 模型,内置 54 种语音选项,默认使用 af_sky,支持 0.5-2.0 倍速调节、去齿音处理和 SSML 标签。STT 采用 Parakeet TDT v3 模型,支持 25 种语言识别,延迟仅 0.2-0.3 秒。首次请求需加载模型(约 8-10 秒),后续请求均为亚秒级响应。

显著优点

极致隐私保护:100% 本地处理,语音数据不上传任何云端服务器,天然符合 GDPR 和 CCPA 合规要求,特别适合医疗、法律、金融等敏感场景。

硬件级性能优化:深度利用 Apple Neural Engine(ANE)进行 CoreML 推理,相比通用 CPU 方案能效比显著提升,同时保持低延迟(TTS 0.6-0.8s,STT 0.2-0.3s)。

零运营成本:无 API 调用费用、无订阅门槛,一次性部署永久使用,离线环境完全可用。

高度可定制:开源 Swift 实现,支持修改源码更换默认语音、调整服务参数,开发者可根据需求深度集成到语音助手、自动化工作流等场景中。

潜在缺点与局限性

平台锁定严重:仅支持 macOS 14+ 和 Apple Silicon(M1/M2/M3/M4),x86 Mac 和 Windows/Linux 用户完全无法使用,生态兼容性受限。

首次启动冷启动慢:模型加载需 8-10 秒,对于需要即时响应的交互场景体验不佳,需保持服务常驻内存。

依赖管理复杂:需要用户自行安装 Xcode 命令行工具、Swift 5.9+、Homebrew 及 espeak-ng,对非技术用户门槛较高;且依赖 FluidAudio 和 Hummingbird 两个第三方开源项目,存在供应链更新风险。

功能边界明确:不支持实时流式语音输入输出,仅支持完整音频文件处理;语音克隆、情感微调等高级功能缺失,54 种预设语音虽多但无法自定义声线。

适合的目标群体

  • 隐私敏感型开发者:医疗记录转录、法律咨询语音助手、金融交易语音验证等场景的技术团队
  • Apple 生态重度用户:已深度使用 Mac 作为主力开发或工作设备,希望统一语音交互体验
  • 离线/内网环境工作者:军工、政府、科研等无法连接外网的机构技术人员
  • 成本敏感型初创团队:需要基础 TTS/STT 能力但不愿承担云服务订阅费用
  • Swift/Apple 技术栈开发者:希望研究 CoreML 部署、本地 AI 推理的技术爱好者

使用风险

供应链安全风险:需从 GitHub 下载 FluidAudio 和 Hummingbird 依赖,建议校验 Package.resolved 中的校验和;espeak-ng 通过 Homebrew 安装也存在被恶意包替换的可能。

服务稳定性风险:作为用户级 LaunchAgent 运行,若进程崩溃或日志目录权限异常,可能导致服务不可用;且无内置自动重试或健康恢复机制,需用户手动排查。

模型文件来源风险:首次运行时自动下载的 CoreML 模型文件(约数百 MB)来源为 FluidAudio 官方 CDN,若网络环境不可信存在中间人攻击可能。

资源占用风险:常驻内存占用约 2-4GB(模型加载后),对 8GB 内存的入门款 Mac 可能引发内存压力;持续占用 ANE 资源可能影响其他机器学习任务的并行执行。

版本兼容性风险:Swift 5.9+ 和 macOS 14+ 的硬性要求意味着旧系统用户被排除,且未来 Apple 架构迭代(如 M5)可能存在兼容性不确定性。

Local Voice (FluidAudio TTS/STT) 内容

references文件夹
scripts文件夹
sources文件夹
Sources文件夹
StellaVoice文件夹
手动下载zip · 9.0 kB
VOICES.mdtext/markdown
请选择文件