SiliconFlow TTS Gen

🎙️ 超低延迟多语言语音合成

基于SiliconFlow API的文本转语音工具,支持8种预设音色、多语言及方言,150ms超低延迟,3秒极速语音克隆。

收藏
6.2k
安装
1.5k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

siliconflow-tts-gen 是一个调用 SiliconFlow 云端 TTS 服务的命令行工具,底层采用 CosyVoice2 模型。用户通过 Python 脚本 generate.py 输入文本即可生成音频,支持 8 种预设音色(4 男 4 女)、中英日韩多语言及 5 种中国方言(粤语、四川话、上海话、天津话、武汉话)。

典型工作流
1. 配置 SILICONFLOW_API_KEY 环境变量

2. 执行 python3 scripts/generate.py "文本内容" --voice bella --speed 1.0 --output result.mp3

3. 音频自动保存至本地,支持 mp3/wav/opus/pcm 格式

进阶特性

  • --list-voices 快速查看可用音色
  • 语速调节范围 0.25x-4x
  • 3 秒语音克隆能力(需额外配置)

显著优点

  • 超低延迟:首包延迟仅 150ms,适合实时交互场景
  • 音色丰富:8 种预设覆盖沉稳、激情、温柔等多风格
  • 方言支持:罕见地支持 5 种中国方言,本土化程度高
  • 零依赖运行:仅需 Python 环境,无需本地模型部署
  • 格式灵活:支持主流音频格式输出

潜在缺点与局限性

  • 云端依赖:必须联网调用 SiliconFlow API,无法离线使用
  • 商业成本:API 调用按 token 计费,高频使用成本累积
  • 隐私风险:文本内容需上传至 api.siliconflow.cn,敏感内容存在泄露隐患
  • 配置门槛:需注册 SiliconFlow 账号并获取 API key
  • 克隆限制:3 秒语音克隆功能文档说明简略,实际效果待验证

适合人群

  • 需要快速生成中文方言语音的内容创作者
  • 开发语音交互应用的开发者(原型验证阶段)
  • 对云端 TTS 延迟敏感的用户(150ms 级别)
  • 不愿本地部署大模型的轻量级用户

常规风险

  • API Key 泄露:环境变量或配置文件中的密钥可能被其他进程读取
  • 服务中断:SiliconFlow 服务故障或账户欠费将导致功能失效
  • 数据跨境:音频合成请求可能涉及数据出境合规问题
  • 内容审核:云端服务商可能对生成内容进行审核或限制

SiliconFlow TTS Gen 内容

scripts文件夹
手动下载zip · 6.5 kB
generate.pytext/plain
请选择文件