chichi-speech (local text-to-speech service with Qwen3-TTS model)

🎙️ Qwen3 极速语音克隆服务

基于 Qwen3 的 FastAPI 语音克隆服务,支持复用参考音频实现高效、一致的 TTS 合成,适合需要固定音色的本地化部署场景。

收藏
10.4k
安装
2.5k
版本
1.0.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Chichi Speech 是一个 FastAPI 封装的 RESTful TTS 服务,基于 Qwen3 模型实现高质量语音合成。用户通过 CLI 启动服务后,可通过 HTTP POST 请求调用 /synthesize 端点生成语音。核心设计亮点在于预计算参考音频 Prompt机制:服务启动时加载指定参考音频并缓存其声学特征,避免每次合成时重复计算,显著提升响应速度并确保音色一致性。

启动与配置

  • 默认监听 0.0.0.0:9090
  • 关键参数 --ref-audio 指定克隆目标音色(强烈建议自定义,默认使用 Qwen3 公开样例)
  • 支持 --ref-text 提供参考音频的文本标注以优化对齐

API 调用

curl -X POST "http://localhost:9090/synthesize" \
  -H "Content-Type: application/json" \
  -d '{"text": "Hello world", "language": "English"}' \
  --output output.wav

显著优点

1. 效率优化:预缓存参考音频特征,避免重复编码,降低延迟
2. 音色一致性:同一服务实例内所有合成使用同一声学 Prompt,确保输出稳定

3. 本地化部署:完全离线运行,无第三方 API 调用,数据隐私可控

4. Qwen3 底座:受益于阿里最新 TTS 模型的自然度和多语言支持

5. 轻量封装pip install 一键安装,FastAPI 提供自动文档 (/docs)

潜在缺点与局限性

  • 单实例单音色:每个服务进程绑定一个参考音频,多音色需求需启动多实例
  • 资源占用:Qwen3 模型需 GPU 或充足 CPU 内存,边缘设备部署受限
  • 依赖较重:需 Python 3.10+、uv、git 及 qwen-tts 库,环境准备较复杂
  • 无内置认证:本地服务默认无鉴权,公网暴露存在安全风险
  • 参考音频质量敏感:克隆效果直接依赖输入音频的清晰度与录音环境

适合人群

  • 需要固定角色音色的内容创作者(有声书、播客、虚拟主播)
  • 注重数据隐私的企业级 TTS 本地化方案
  • 已具备 Qwen3 运行环境的开发者,希望快速封装 REST API
  • 对延迟敏感、需高频调用的实时语音合成场景

常规风险

| 风险类型 | 说明 |
|---------|------|
| **版权合规** | 克隆他人声音可能涉及肖像权/版权,需确保参考音频合法授权 |
| **公网暴露** | 默认服务无认证,直接暴露至互联网可能被滥用 |
| **模型偏见** | 合成内容可能意外复现训练数据中的偏见,需人工审核 |
| **依赖维护** | `qwen-tts` 为较新库,API 稳定性与长期支持需观察 |

chichi-speech (local text-to-speech service with Qwen3-TTS model) 内容

手动下载zip · 1.2 kB
SKILL.mdtext/markdown
请选择文件