核心用法
Zai-TTS 是通过 uvx zai-tts 命令调用智谱AI GLM-TTS 服务的文本转语音工具。用户需先在 audio.z.ai 注册并获取 ZAI_AUDIO_USERID 和 ZAI_AUDIO_TOKEN 环境变量,通过浏览器开发者工具从 localStorage 提取凭证。基础用法为 uvx zai-tts -t "文本" -o 输出路径,支持调节语速(--speed)、音量(--volume)及切换预设音色(--voice)。内置 Lila、Chloe、Ethan 三种官方音色,也可使用网站克隆的自定义声音。
显著优点
- 音质优秀:依托智谱GLM大模型,合成语音自然度高,情感表达细腻
- 轻量便捷:通过
uvx零安装运行,无需本地模型部署 - 灵活调控:支持1.0-2.0倍速调节、音量增益及多音色切换
- 自定义扩展:支持官网克隆个人专属声音,满足个性化需求
潜在局限
- 凭证获取繁琐:需手动通过浏览器F12开发者工具提取token,门槛较高
- 网络依赖:完全依赖云端服务,无离线能力
- 隐私考量:文本内容需上传至智谱服务器处理
- 平台限制:暂不支持Windows原生安装,依赖uv/uvx工具链
适合人群
- 内容创作者(播客、有声书、视频配音)
- 无障碍需求用户(视障辅助、阅读障碍支持)
- 多任务场景使用者(驾驶、烹饪时收听长文)
- 开发者集成TTS能力至自动化工作流
常规风险
- 凭证泄露风险:Token存储于环境变量,需避免提交至代码仓库
- 服务稳定性:第三方API可能受网络波动或配额限制影响
- 内容合规:合成内容需遵守平台使用协议,禁止生成违法违规音频