核心用法
siliconflow-tts-gen 是一个调用 SiliconFlow 云端 TTS 服务的命令行工具,底层采用 CosyVoice2 模型。用户通过 Python 脚本 generate.py 输入文本即可生成音频,支持 8 种预设音色(4 男 4 女)、中英日韩多语言及 5 种中国方言(粤语、四川话、上海话、天津话、武汉话)。
典型工作流:
1. 配置 SILICONFLOW_API_KEY 环境变量
2. 执行 python3 scripts/generate.py "文本内容" --voice bella --speed 1.0 --output result.mp3
3. 音频自动保存至本地,支持 mp3/wav/opus/pcm 格式
进阶特性:
--list-voices快速查看可用音色- 语速调节范围 0.25x-4x
- 3 秒语音克隆能力(需额外配置)
显著优点
- 超低延迟:首包延迟仅 150ms,适合实时交互场景
- 音色丰富:8 种预设覆盖沉稳、激情、温柔等多风格
- 方言支持:罕见地支持 5 种中国方言,本土化程度高
- 零依赖运行:仅需 Python 环境,无需本地模型部署
- 格式灵活:支持主流音频格式输出
潜在缺点与局限性
- 云端依赖:必须联网调用 SiliconFlow API,无法离线使用
- 商业成本:API 调用按 token 计费,高频使用成本累积
- 隐私风险:文本内容需上传至
api.siliconflow.cn,敏感内容存在泄露隐患 - 配置门槛:需注册 SiliconFlow 账号并获取 API key
- 克隆限制:3 秒语音克隆功能文档说明简略,实际效果待验证
适合人群
- 需要快速生成中文方言语音的内容创作者
- 开发语音交互应用的开发者(原型验证阶段)
- 对云端 TTS 延迟敏感的用户(150ms 级别)
- 不愿本地部署大模型的轻量级用户
常规风险
- API Key 泄露:环境变量或配置文件中的密钥可能被其他进程读取
- 服务中断:SiliconFlow 服务故障或账户欠费将导致功能失效
- 数据跨境:音频合成请求可能涉及数据出境合规问题
- 内容审核:云端服务商可能对生成内容进行审核或限制