🗣️ Text-to-speech using GLM-TTS for generating audio

🗣️ GLM 大模型语音合成,自然动听

基于GLM-TTS的高音质语音合成工具,支持多音色选择、语速调节与自定义声纹克隆,适合内容创作与无障碍场景。

收藏
5.3k
安装
1.4k
版本
1.0.2
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Zai-TTS 是一款调用 GLM-TTS 云端服务的文本转语音工具,通过 uvx zai-tts 命令行快速生成音频。用户需先在 audio.z.ai 登录并提取 userIdtoken 配置环境变量,即可将任意文本转为 WAV 格式音频。支持参数化调节语速(--speed)、音量(--volume)及切换系统预设音色(--voice),并提供语音克隆功能供高级用户定制专属声线。

显著优点

  • 音质优异:依托 GLM-TTS 大模型,合成语音自然度高,情感表达细腻
  • 轻量便捷:基于 uvx 零安装运行,无需复杂依赖管理
  • 灵活可控:支持 3 种系统音色(Lila/Chloe/Ethan),语速/音量自由调节
  • 扩展性强:支持用户自主克隆声纹,满足个性化品牌声音需求

潜在局限

  • 网络依赖:必须联网调用云端 API,离线场景无法使用
  • 认证门槛:需手动从浏览器 DevTools 提取 Token,配置流程对非技术用户不够友好
  • 平台绑定:深度耦合 Z.ai 生态,迁移成本较高
  • 格式单一:目前仅输出 WAV,需额外转码为 MP3 等常用格式

适合人群

  • 内容创作者(播客、短视频配音、有声书制作)
  • 开发者需批量生成语音通知或 IVR 系统提示音
  • 视障用户及无障碍辅助工具集成者
  • 追求自然语音合成效果的企业客服场景

常规风险

Token 以明文形式存储于环境变量,在共享环境或 CI/CD 流水线中存在泄露风险;建议配合密钥管理工具(如 1Password CLI、GitHub Secrets)使用。语音克隆功能涉及声纹生物特征数据,需关注平台隐私条款与数据留存政策。

🗣️ Text-to-speech using GLM-TTS for generating audio 内容

手动下载zip · 1.3 kB
SKILL.mdtext/markdown
请选择文件