🗣️ Text-to-speech using GLM-TTS for generating audio

🗣️ 智谱AI语音合成 · 自然音色随心调

基于智谱AI GLM-TTS的高质量语音合成工具,支持多音色选择与参数调节,需配置API密钥使用。

收藏
6.1k
安装
1.4k
版本
1.0.1
CLS 安全性认证2026-08-03
点击查看完整报告 >

使用说明

核心用法

Zai-TTS 是通过 uvx zai-tts 命令调用智谱AI GLM-TTS 服务的文本转语音工具。用户需先在 audio.z.ai 注册并获取 ZAI_AUDIO_USERIDZAI_AUDIO_TOKEN 环境变量,通过浏览器开发者工具从 localStorage 提取凭证。基础用法为 uvx zai-tts -t "文本" -o 输出路径,支持调节语速(--speed)、音量(--volume)及切换预设音色(--voice)。内置 Lila、Chloe、Ethan 三种官方音色,也可使用网站克隆的自定义声音。

显著优点

  • 音质优秀:依托智谱GLM大模型,合成语音自然度高,情感表达细腻
  • 轻量便捷:通过 uvx 零安装运行,无需本地模型部署
  • 灵活调控:支持1.0-2.0倍速调节、音量增益及多音色切换
  • 自定义扩展:支持官网克隆个人专属声音,满足个性化需求

潜在局限

  • 凭证获取繁琐:需手动通过浏览器F12开发者工具提取token,门槛较高
  • 网络依赖:完全依赖云端服务,无离线能力
  • 隐私考量:文本内容需上传至智谱服务器处理
  • 平台限制:暂不支持Windows原生安装,依赖uv/uvx工具链

适合人群

  • 内容创作者(播客、有声书、视频配音)
  • 无障碍需求用户(视障辅助、阅读障碍支持)
  • 多任务场景使用者(驾驶、烹饪时收听长文)
  • 开发者集成TTS能力至自动化工作流

常规风险

  • 凭证泄露风险:Token存储于环境变量,需避免提交至代码仓库
  • 服务稳定性:第三方API可能受网络波动或配额限制影响
  • 内容合规:合成内容需遵守平台使用协议,禁止生成违法违规音频

安全解读

核心用法

zai-tts 是一个纯文档型 Agent Skill,本身不包含可执行代码,而是通过调用外部命令行工具 uvx zai-tts 实现文本转语音(TTS)功能。用户需先在 audio.z.ai 平台注册账号,通过浏览器开发者工具获取 ZAI_AUDIO_USERIDZAI_AUDIO_TOKEN,配置为环境变量后即可使用。

基础调用格式为 uvx zai-tts -t "{文本}" -o {输出路径}.mp3,支持 --speed 调节语速(如 1.5 倍速)、--volume 调节音量、--voice 切换音色。内置三种官方音色:Lila(活泼女声)、Chloe(优雅女声)、Ethan(阳光男声),也可通过 -l 参数查看全部可用音色,或先在平台完成语音克隆后使用自定义声线。

显著优点

安全架构极简:本 Skill 为纯 Markdown 文档型设计,仅包含 SKILL.md 和 _meta.json,无可执行脚本、无危险函数调用、无第三方依赖,从源头消除代码注入和恶意执行风险,获得 CLS S+ 顶级安全认证。

来源可信度高:由 GitHub Organization aahl 维护,主要贡献者活跃开发,仓库拥有 190+ stars,采用 Apache 2.0 开源许可,属于 T2 级可信社区项目。

功能实用完整:背靠智谱AI(Zhipu AI)的 GLM-TTS 服务,语音合成质量处于行业第一梯队;支持语速、音量、音色多维调节,覆盖旁白、播客、有声书等多场景;兼容预克隆声线,满足个性化需求。

部署轻量便捷:依赖 uvx 工具(可通过 brew 或 pip 安装),无需复杂环境配置,跨平台可用。

潜在缺点与局限性

外部服务依赖:核心 TTS 能力完全依赖第三方平台 audio.z.ai,需联网使用,存在服务可用性风险;若智谱AI调整 API 或计费策略,可能影响功能稳定性。

配置门槛存在:需手动访问网站、通过浏览器控制台提取用户ID和Token,对非技术用户不够友好;环境变量配置流程也增加了初次使用成本。

功能边界清晰:本 Skill 仅作为调用封装,不直接处理音频文件管理、批量转换、格式转换等增值功能,复杂需求需配合其他工具链。

隐私数据流转:文本内容和合成音频会传输至智谱AI服务器,敏感内容需谨慎评估。

适合的目标群体

  • 内容创作者:需要将文章、脚本快速转换为播客音频、视频旁白的自媒体从业者
  • 无障碍需求用户:视力障碍者或偏好听觉获取信息的多任务场景用户
  • 开发者与自动化爱好者:希望将 TTS 能力集成到工作流、脚本或 Agent 中的技术用户
  • 多语言学习者:需要标准发音示范的语言学习场景

使用风险说明

性能风险:音频合成依赖云端 API,网络延迟和服务器负载可能影响响应速度;大文本需分段处理,单次超长内容可能失败。

成本风险:智谱AI TTS 服务存在调用配额和计费策略,高频或商业使用需关注费用控制。

密钥管理风险ZAI_AUDIO_TOKEN 属于敏感凭证,若在共享环境或日志中泄露,可能导致账号滥用;建议配合密钥管理系统使用。

依赖项风险uvx 工具及其背后的 zai-tts Python 包版本更新可能引入破坏性变更,建议锁定版本或监控更新。

合规风险提示:使用语音克隆功能时,需确保获得被克隆人声者的合法授权,避免侵权风险。

🗣️ Text-to-speech using GLM-TTS for generating audio 内容

手动下载zip · 1.3 kB
SKILL.mdtext/markdown
请选择文件