🗣️ Text-to-speech using GLM-TTS for generating audio

🗣️ 智谱GLM语音合成,一键生成自然人声

基于智谱GLM-TTS的高质量文本转语音工具,支持多角色音色、语速调节,适合内容创作与无障碍场景

收藏
6.6k
安装
1.4k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Zai-TTS 是一款基于智谱 AI GLM-TTS 服务的命令行文本转语音工具,通过 uvx zai-tts 调用。核心工作流程为:

1. 环境配置:需先注册 audio.z.ai 获取 ZAI_AUDIO_USERIDZAI_AUDIO_TOKEN(通过浏览器开发者工具读取 localStorage)
2. 基础合成uvx zai-tts -t "文本内容" -o 输出路径.mp3

3. 参数调节:支持 --speed(语速,默认1.0)、--volume(音量倍数)、--voice(音色切换)

4. 音色选择:内置 Lila(活泼女声)、Chloe(知性女声)、Ethan(阳光男声)三种系统音色,可通过 -l 查看完整列表,支持官网克隆自定义音色

显著优点

  • 中文合成质量优异:GLM-TTS 基于智谱大模型,中文韵律自然度显著优于传统 TTS
  • 零依赖快速部署:通过 uvx 直接运行,无需本地 Python 环境配置
  • 多场景适配:预设音色覆盖不同风格,支持播客、有声书、语音助手等场景
  • 参数精细控制:语速、音量可调,满足无障碍阅读(视障辅助)、驾驶/烹饪等多任务场景

潜在缺点与局限性

  • 认证门槛较高:需手动通过浏览器 DevTools 提取 token,对非技术用户不够友好
  • 依赖外部服务:必须联网调用智谱 API,离线不可用;存在服务稳定性风险
  • token 安全性存疑:安装指引中 secret: false 标记 token 为非敏感,但实际具备账户访问权限,存在误操作泄露风险
  • 自定义音色限制:克隆音色需先完成官网流程,无法本地即时创建
  • 平台限制:目前仅支持通过 uvx 运行,Windows 原生支持未明确

适合人群

  • 内容创作者:快速生成播客、短视频配音、有声内容
  • 开发者/极客:需要程序化生成语音的 CLI 工具用户
  • 无障碍需求者:视障用户、阅读障碍者的文本朗读辅助
  • 多任务场景用户:通勤、家务时听取长文本内容

常规风险

| 风险类型 | 说明 |
|---------|------|
| **凭证泄露** | Token 需手动提取,若复制到不安全位置可能导致账户被盗用 |
| **API 依赖** | 服务变更或下线将导致功能失效,无本地 fallback |
| **内容合规** | 生成语音需遵守智谱平台的内容审核政策,敏感内容可能被拦截 |
| **隐私数据** | 文本内容上传至智谱服务器处理,敏感信息需谨慎评估 |

🗣️ Text-to-speech using GLM-TTS for generating audio 内容

手动下载zip · 1.3 kB
SKILL.mdtext/markdown
请选择文件