Local Voice (FluidAudio TTS/STT)

🔊 Apple Silicon 本地化语音 AI 引擎

Apple Silicon 本地化语音合成与识别方案,基于 FluidAudio CoreML 模型,通过 Apple Neural Engine 实现亚秒级 TTS/STT,完全离线运行。

收藏
10.6k
安装
2.2k
版本
1.0.0
CLS 安全性认证2026-08-11
点击查看完整报告 >

使用说明

核心功能

Local Voice 是一款面向 Apple Silicon Mac 的本地化语音 AI 解决方案,整合 FluidAudio 的 CoreML 模型实现高性能文本转语音(TTS)与语音转文本(STT)。该方案通过 HTTP 守护进程提供服务,无需云端依赖,在隐私保护与响应速度方面具有显著优势。

TTS 能力:基于 Kokoro 模型,提供 54 种预设音色,典型延迟 0.6-0.8 秒,支持语速调节(0.5-2.0x)、去齿音处理及基础 SSML 标签。推荐音色包括 af_heart(温暖自然)、af_bella(富有表现力)等。

STT 能力:采用 Parakeet TDT v3 模型,延迟约 0.2-0.3 秒,支持 25 种语言识别,适合实时交互场景。

显著优点

1. 完全本地化:零云端依赖,无 API 费用,离线可用,从根本上消除语音数据外泄风险
2. 硬件加速:深度利用 Apple Neural Engine,能效比优于 CPU 推理方案

3. 亚秒级延迟:首载后响应时间低于 1 秒,显著优于多数云端 TTS 服务

4. 开发者友好:提供简洁 REST API,易于集成至现有语音助手或自动化工作流

潜在局限

  • 平台限制:仅限 macOS 14+ 与 Apple Silicon 设备,x86 架构及旧版本系统不支持
  • 首次冷启动:模型初始加载需 8-10 秒,需合理设计预加载策略
  • 音色定制受限:54 种预设音色无法自定义训练,个性化程度低于部分云端方案
  • SSML 支持有限:仅支持基础标签(phoneme、sub、say-as),复杂场景表现力不足

适用人群

  • 注重隐私的本地 AI 用户(如 StellaScreen 等语音助手开发者)
  • 需要离线语音能力的 macOS 自动化工作流构建者
  • 希望替代 Azure/ AWS/ Google 云 TTS 以降低成本的企业开发者
  • Apple 生态深度用户,追求端侧 AI 体验

常规风险

1. 构建复杂度:需 Swift 工具链、espeak-ng 依赖及手动处理动态库路径,对非开发者门槛较高
2. 守护进程稳定性:LaunchAgent 配置不当可能导致服务异常退出,需监控日志输出

3. 模型更新维护:CoreML 模型需跟随 FluidAudio 上游更新,存在兼容性维护成本

4. 资源占用:Neural Engine 推理虽高效,但多并发场景下可能与其他 ML 任务竞争算力

安全解读

核心用法

local-voice 是专为 Apple Silicon Mac 设计的本地化语音 AI 技能,集成 FluidAudio 的 CoreML 模型,通过 Swift 守护进程提供 HTTP API 服务。用户需先安装 espeak-ng 依赖,编译 Swift 项目后将二进制文件部署至 ~/clawd/bin/,并创建 LaunchAgent 实现开机自启。

守护进程监听 127.0.0.1:18790,提供三大核心端点:/synthesize 将文本转为 WAV/MP3 音频(支持 54 种 Kokoro 音色、语速调节 0.5-2.0 倍、SSML 标签);/transcribe 基于 Parakeet TDT v3 模型将音频转为文本(支持 25 种语言,延迟约 0.2-0.3 秒);/health 提供健康检查。首次请求需加载模型(约 8-10 秒),后续请求稳定在亚秒级响应。

显著优点

隐私零妥协:100% 本地处理,语音数据不出设备,天然符合 GDPR/CCPA 等隐私法规,适合医疗、法律等敏感场景。成本极致优化:无按量计费、无 API 密钥,一次性部署后永久免费使用。性能卓越:Apple Neural Engine 加速下,TTS 延迟 0.6-0.8 秒,STT 延迟 0.2-0.3 秒,媲美云端服务。离线可用:无需网络连接,飞机、野外等场景照常工作。音色丰富:54 种预设音色,涵盖美式、英式、日式等多语种声线,支持语速、情感标点、SSML 细粒度控制。

潜在缺点与局限性

硬件门槛严格:仅限 macOS 14+ 与 Apple Silicon(M1/M2/M3/M4),Intel Mac 完全不支持。首次冷启动慢:模型加载需 8-10 秒,不适合突发瞬时调用场景。依赖维护风险:核心依赖 FluidAudio 为 T3 级别个人开发者项目,长期维护稳定性存疑。配置复杂度:需手动编译 Swift、处理动态库路径、编写 LaunchAgent,对非开发者用户门槛较高。生态局限:无 Windows/Linux 版本,跨平台项目需额外方案。

适合的目标群体

隐私敏感型用户:律师、医生、心理咨询师等需处理机密语音数据的职业。成本敏感开发者:希望为语音助手、播客工具、无障碍应用集成 TTS/STT,但抗拒云端 API 持续计费。Apple 生态深度用户:已部署 StellaScreen 等本地 Agent,寻求无缝语音交互能力。离线场景刚需者:经常处于网络受限环境,仍需语音交互功能的研究人员、野外工作者。技术爱好者:愿意折腾编译部署,追求极致本地化 AI 体验的极客用户。

使用风险

依赖供应链风险:FluidAudio 若停止维护或出现安全漏洞,可能影响功能与安全,建议锁定精确版本并持续关注仓库动态。权限管理隐患:LaunchAgent 安装脚本修改用户目录配置,虽无系统级风险,但需警惕第三方篡改后的恶意脚本,建议审查后再执行。模型首载延迟:生产环境需预热策略,避免用户首次调用体验不佳。日志泄露风险:当前实现可能将转录文本记录于日志,敏感场景需自行配置日志过滤规则。架构兼容陷阱:必须为 ARM64 原生编译,Rosetta 转译会导致运行失败,CI/CD 需显式指定目标架构。

Local Voice (FluidAudio TTS/STT) 内容

references文件夹
scripts文件夹
sources文件夹
Sources文件夹
StellaVoice文件夹
手动下载zip · 7.8 kB
VOICES.mdtext/markdown
请选择文件