Mlx Tts

🔊 Apple Silicon 本地语音合成,隐私零泄露

Apple Silicon 本地文本转语音,无需 API 密钥,支持 12+ 模型含中文优化,完全离线保障隐私

收藏
1.3k
安装
624
版本
0.1.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能

mlx-tts 是基于 Apple MLX 框架的完全本地化文本转语音(TTS)技能,专为 Apple Silicon 芯片优化。它通过 mlx-audio 库在本地运行神经语音合成,无需调用任何云端 API,从根本上杜绝了数据外泄风险。

显著优点

隐私与安全:所有语音合成在设备本地完成,文本和生成的音频均不上传至任何服务器,适合处理敏感内容。

多模型支持:内置 12+ 种开源语音模型,涵盖从轻量(Soprano-80M,~200MB)到高质量(Qwen3-TTS-1.7B,~16GB)的完整谱系。特别推荐 Kokoro-82M(多语言轻量)和 Qwen3-TTS-0.6B(中文质量优秀)。

Apple Silicon 深度优化:基于 MLX 框架充分利用 Apple 芯片的神经网络引擎(ANE),推理效率显著优于通用 PyTorch 方案。

零 API 成本:完全开源免费,无用量限制或订阅费用。

灵活配置:支持语速调节(0.5-2.0x)、多语言代码指定、自定义输出路径、实时配置重载。

潜在缺点与局限性

硬件门槛:仅支持 Apple Silicon(M1/M2/M3/M4),Intel Mac 无法运行。大模型(如 Ming-omni-16.8B)需 32GB+ 统一内存。

首次冷启动慢:模型需下载缓存(首次)并预热,首条语音可能延迟数秒至数十秒,取决于模型大小。

中文支持不均衡:部分模型(CSM-1B、Dia-1.6B、Soprano)仅支持英文,中文场景需特意选择 Qwen3-TTS 或 Kokoro。

路径限制严格:输出路径被锁定在 /tmp~/.openclaw/voice/outputs/,且禁止符号链接,灵活性受限。

维护状态存疑:依赖 mlx-audio--prerelease 版本,可能存在 API 变动或稳定性风险。

适合人群

  • Apple Silicon 用户且重视隐私安全
  • 需要离线工作的开发者、播客创作者、无障碍辅助用户
  • 中文语音合成需求者(选择 Qwen3-TTS 模型)
  • 希望零成本、无限量 TTS 的个人用户

常规风险

  • 依赖预发布软件mlx-audio 尚未稳定版,升级可能破坏兼容性
  • 大内存占用:运行多模型或 16B+ 参数模型时,需确保系统内存充足,避免触发 macOS 内存压缩/交换导致性能骤降
  • 模型下载来源:默认从 Hugging Face Hub 下载,若使用镜像需确认镜像可信性
  • 无内容过滤:本地运行意味着无云端的内容审核,生成内容责任完全由用户承担

Mlx Tts 内容

手动下载zip · 3.4 kB
skill-card.mdtext/markdown
请选择文件