核心用法
Chichi Speech 是一个 FastAPI 封装的 RESTful TTS 服务,基于 Qwen3 模型实现高质量语音合成。用户通过 CLI 启动服务后,可通过 HTTP POST 请求调用 /synthesize 端点生成语音。核心设计亮点在于预计算参考音频 Prompt机制:服务启动时加载指定参考音频并缓存其声学特征,避免每次合成时重复计算,显著提升响应速度并确保音色一致性。
启动与配置
- 默认监听
0.0.0.0:9090 - 关键参数
--ref-audio指定克隆目标音色(强烈建议自定义,默认使用 Qwen3 公开样例) - 支持
--ref-text提供参考音频的文本标注以优化对齐
API 调用
curl -X POST "http://localhost:9090/synthesize" \
-H "Content-Type: application/json" \
-d '{"text": "Hello world", "language": "English"}' \
--output output.wav显著优点
1. 效率优化:预缓存参考音频特征,避免重复编码,降低延迟
2. 音色一致性:同一服务实例内所有合成使用同一声学 Prompt,确保输出稳定
3. 本地化部署:完全离线运行,无第三方 API 调用,数据隐私可控
4. Qwen3 底座:受益于阿里最新 TTS 模型的自然度和多语言支持
5. 轻量封装:pip install 一键安装,FastAPI 提供自动文档 (/docs)
潜在缺点与局限性
- 单实例单音色:每个服务进程绑定一个参考音频,多音色需求需启动多实例
- 资源占用:Qwen3 模型需 GPU 或充足 CPU 内存,边缘设备部署受限
- 依赖较重:需 Python 3.10+、
uv、git 及qwen-tts库,环境准备较复杂 - 无内置认证:本地服务默认无鉴权,公网暴露存在安全风险
- 参考音频质量敏感:克隆效果直接依赖输入音频的清晰度与录音环境
适合人群
- 需要固定角色音色的内容创作者(有声书、播客、虚拟主播)
- 注重数据隐私的企业级 TTS 本地化方案
- 已具备 Qwen3 运行环境的开发者,希望快速封装 REST API
- 对延迟敏感、需高频调用的实时语音合成场景
常规风险
| 风险类型 | 说明 |
|---------|------|
| **版权合规** | 克隆他人声音可能涉及肖像权/版权,需确保参考音频合法授权 |
| **公网暴露** | 默认服务无认证,直接暴露至互联网可能被滥用 |
| **模型偏见** | 合成内容可能意外复现训练数据中的偏见,需人工审核 |
| **依赖维护** | `qwen-tts` 为较新库,API 稳定性与长期支持需观察 |