核心用法
Zai-TTS 是一款基于智谱 AI GLM-TTS 服务的命令行文本转语音工具,通过 uvx zai-tts 调用。核心工作流程为:
1. 环境配置:需先注册 audio.z.ai 获取 ZAI_AUDIO_USERID 和 ZAI_AUDIO_TOKEN(通过浏览器开发者工具读取 localStorage)
2. 基础合成:uvx zai-tts -t "文本内容" -o 输出路径.mp3
3. 参数调节:支持 --speed(语速,默认1.0)、--volume(音量倍数)、--voice(音色切换)
4. 音色选择:内置 Lila(活泼女声)、Chloe(知性女声)、Ethan(阳光男声)三种系统音色,可通过 -l 查看完整列表,支持官网克隆自定义音色
显著优点
- 中文合成质量优异:GLM-TTS 基于智谱大模型,中文韵律自然度显著优于传统 TTS
- 零依赖快速部署:通过
uvx直接运行,无需本地 Python 环境配置 - 多场景适配:预设音色覆盖不同风格,支持播客、有声书、语音助手等场景
- 参数精细控制:语速、音量可调,满足无障碍阅读(视障辅助)、驾驶/烹饪等多任务场景
潜在缺点与局限性
- 认证门槛较高:需手动通过浏览器 DevTools 提取 token,对非技术用户不够友好
- 依赖外部服务:必须联网调用智谱 API,离线不可用;存在服务稳定性风险
- token 安全性存疑:安装指引中
secret: false标记 token 为非敏感,但实际具备账户访问权限,存在误操作泄露风险 - 自定义音色限制:克隆音色需先完成官网流程,无法本地即时创建
- 平台限制:目前仅支持通过
uvx运行,Windows 原生支持未明确
适合人群
- 内容创作者:快速生成播客、短视频配音、有声内容
- 开发者/极客:需要程序化生成语音的 CLI 工具用户
- 无障碍需求者:视障用户、阅读障碍者的文本朗读辅助
- 多任务场景用户:通勤、家务时听取长文本内容
常规风险
| 风险类型 | 说明 |
|---------|------|
| **凭证泄露** | Token 需手动提取,若复制到不安全位置可能导致账户被盗用 |
| **API 依赖** | 服务变更或下线将导致功能失效,无本地 fallback |
| **内容合规** | 生成语音需遵守智谱平台的内容审核政策,敏感内容可能被拦截 |
| **隐私数据** | 文本内容上传至智谱服务器处理,敏感信息需谨慎评估 |