核心功能
mlx-tts 是基于 Apple MLX 框架的完全本地化文本转语音(TTS)技能,专为 Apple Silicon 芯片优化。它通过 mlx-audio 库在本地运行神经语音合成,无需调用任何云端 API,从根本上杜绝了数据外泄风险。
显著优点
隐私与安全:所有语音合成在设备本地完成,文本和生成的音频均不上传至任何服务器,适合处理敏感内容。
多模型支持:内置 12+ 种开源语音模型,涵盖从轻量(Soprano-80M,~200MB)到高质量(Qwen3-TTS-1.7B,~16GB)的完整谱系。特别推荐 Kokoro-82M(多语言轻量)和 Qwen3-TTS-0.6B(中文质量优秀)。
Apple Silicon 深度优化:基于 MLX 框架充分利用 Apple 芯片的神经网络引擎(ANE),推理效率显著优于通用 PyTorch 方案。
零 API 成本:完全开源免费,无用量限制或订阅费用。
灵活配置:支持语速调节(0.5-2.0x)、多语言代码指定、自定义输出路径、实时配置重载。
潜在缺点与局限性
硬件门槛:仅支持 Apple Silicon(M1/M2/M3/M4),Intel Mac 无法运行。大模型(如 Ming-omni-16.8B)需 32GB+ 统一内存。
首次冷启动慢:模型需下载缓存(首次)并预热,首条语音可能延迟数秒至数十秒,取决于模型大小。
中文支持不均衡:部分模型(CSM-1B、Dia-1.6B、Soprano)仅支持英文,中文场景需特意选择 Qwen3-TTS 或 Kokoro。
路径限制严格:输出路径被锁定在 /tmp 或 ~/.openclaw/voice/outputs/,且禁止符号链接,灵活性受限。
维护状态存疑:依赖 mlx-audio 的 --prerelease 版本,可能存在 API 变动或稳定性风险。
适合人群
- Apple Silicon 用户且重视隐私安全
- 需要离线工作的开发者、播客创作者、无障碍辅助用户
- 中文语音合成需求者(选择 Qwen3-TTS 模型)
- 希望零成本、无限量 TTS 的个人用户
常规风险
- 依赖预发布软件:
mlx-audio尚未稳定版,升级可能破坏兼容性 - 大内存占用:运行多模型或 16B+ 参数模型时,需确保系统内存充足,避免触发 macOS 内存压缩/交换导致性能骤降
- 模型下载来源:默认从 Hugging Face Hub 下载,若使用镜像需确认镜像可信性
- 无内容过滤:本地运行意味着无云端的内容审核,生成内容责任完全由用户承担