Qwen3-tts

🔊 本地 AI 语音合成,指令控情感

本地运行的通义千问 TTS,支持 10 语言与指令控制情感语调,离线可用,无需云端 API。

收藏
18.2k
安装
4k
版本
1.0.0
CLS 安全性认证2026-07-12
点击查看完整报告 >

使用说明

核心用法

Qwen TTS 是一款基于 Hugging Face Qwen3-TTS-12Hz-1.7B-CustomVoice 的本地文本转语音工具,用户通过命令行脚本即可生成高质量语音。核心指令为 scripts/tts.py,支持 -l 指定语言、-s 切换 9 种精品说话人、-i 以自然语言指令控制情绪与风格(如 "Parla con entusiasmo")。首次运行需执行 setup.sh 创建约 500MB 的虚拟环境,模型文件约 1.7GB 在首次合成时自动下载,此后完全离线运行。

显著优点

  • 完全本地化:无需订阅 ElevenLabs 等云服务,无 API 费用与网络延迟,适合隐私敏感场景。
  • 多语言支持:覆盖中文、英语、日语、韩语、德语、法语、俄语、葡萄牙语、西班牙语、意大利语 10 种语言,且跨语言合成效果可用。
  • 指令可控:通过 -i 参数以自然语言描述情感、语速、风格,实现零样本风格迁移。
  • 9 种精品音色:包含中英日韩多地域特色说话人,如北京腔 Dylan、成都腔 Eric、美式 Ryan 等,音色区分度鲜明。
  • OpenClaw 兼容:脚本标准输出音频路径,便于自动化工作流集成。

潜在局限

  • 硬件门槛:GPU 合成仅需 1-3 秒,但 CPU 需 10-30 秒,低配置设备体验受限;1.7GB 模型对内存/显存有一定要求。
  • 说话人数量:仅 9 个预设音色,无法像云端服务那样上传自定义声音克隆。
  • 音质上限:16kHz WAV 输出,虽清晰但未达到 44.1kHz 或更高采样率标准,后期如需广播级音质需上采样处理。
  • 中文偏见:模型训练数据以中文为主,非中文说话人合成非母语时可能出现轻微口音或韵律偏差。

适合人群

  • 注重数据隐私、需要离线 TTS 的个人开发者与内容创作者;
  • 多语言应用开发者,需低成本集成意/德/法/俄等语种语音;
  • 希望用自然语言指令快速调整播报情绪、风格的播客与视频制作者;
  • 需要与 OpenClaw 等自动化框架对接的技术用户。

常规风险

  • 初始下载依赖 Hugging Face:首次模型拉取受网络环境影响,中国大陆用户需配置镜像(HF_ENDPOINT);下载失败将导致功能不可用。
  • Python 版本锁定:仅支持 Python 3.10-3.12,系统 Python 版本不匹配需手动安装或调整环境。
  • 许可合规:模型授权条款以 Hugging Face 模型卡为准,商用需自行确认当前 license(如 Qwen License 2.0 或其变体)。
  • 输出文件管理:脚本默认输出至当前目录,未自动清理,长期运行需关注磁盘空间。

安全解读

核心用法

qwen-tts 是基于阿里 Qwen3-TTS-12Hz-1.7B-CustomVoice 模型的本地文本转语音 Skill,主打完全离线运行情感指令控制两大特性。用户通过简单命令行即可将文本转换为自然语音,支持 10 种语言(含意大利语)和 9 种预设说话人音色。

基础用法示例:

scripts/tts.py "Ciao, come va?" -l Italian -o output.wav

情感控制用法:

scripts/tts.py "Sono felice!" -i "Parla con entusiasmo" -l Italian -o happy.wav

核心参数包括 -s 选择说话人(如 Ryan、Vivian)、-l 指定语言、-i 添加情感指令。首次运行自动从 Hugging Face 下载约 1.7GB 模型,之后完全离线可用。

---

显著优点

1. 完全离线,隐私无忧:除首次模型下载外,所有 TTS 处理在本地完成,敏感文本(商业机密、个人隐私)不会上传至第三方云服务,从根本上规避数据泄露风险。

2. 情感指令可控:通过 -i/--instruct 参数可直接用自然语言控制语音风格("Parla con entusiasmo"、"Tono serio e professionale"),无需复杂参数调整,大幅降低创意表达门槛。

3. 多语言原生支持:10 种语言覆盖主流需求,意大利语支持尤其完善,9 种说话人虽各有"母语偏好",但均可跨语言使用,灵活度高。

4. 性能可接受:GPU 加速下短文本 1-3 秒出音,CPU 模式 10-30 秒,作为本地方案已属高效,且自动 CPU/GPU 回退机制提升兼容性。

5. OpenClaw 生态集成:标准输出路径设计,可直接嵌入 OpenClaw 工作流,适合自动化语音内容生产场景。

---

潜在缺点与局限性

1. 存储与显存门槛:总计约 2.2GB 磁盘占用(500MB 环境 + 1.7GB 模型),对边缘设备不友好;GPU 推理需充足显存,否则自动降级至 CPU 导致速度骤降。

2. 首次下载依赖网络:模型必须从 Hugging Face 拉取,国内用户可能需配置 HF_ENDPOINT 镜像,网络受限环境部署困难。

3. 远程模式安全风险:虽为可选功能,但若用户误配置 --remote 指向未加固的公开服务器,可能导致文本/音频被中间人截获。技能文档已主动披露,但安全意识薄弱用户仍可能踩坑。

4. 说话人数量有限:9 种预设音色相比 ElevenLabs 等云服务的数百种声库选择面较窄,且克隆自定义声音需额外技术投入。

5. 输出格式单一:仅支持 16kHz WAV 无损输出,无 MP3/OPUS 等压缩格式选项,大段语音文件体积偏大。

---

适合人群

  • 隐私敏感型用户:律师、医生、心理咨询师等需处理机密对话内容的从业者
  • 离线环境工作者:无稳定外网连接的研发、教育、工业现场场景
  • 多语言内容创作者:需要批量生成意大利语、日语、韩语等小语种配音的自媒体/播客制作人
  • 成本敏感型开发者:不愿持续支付云 TTS API 费用的个人开发者或初创团队
  • AI 语音技术研究者:希望深入理解指令控制 TTS 底层机制的技术爱好者

---

常规风险

| 风险类别 | 具体说明 | 缓解建议 |
|---------|---------|---------|
| **模型供应链** | Hugging Face 仓库被投毒或模型文件遭篡改 | 校验下载文件的 SHA256,关注官方仓库安全公告 |
| **远程模式配置** | 用户错误将本地服务器暴露至公网,导致未授权访问 | 严格限制绑定 127.0.0.1,配置防火墙与 TLS |
| **依赖包漏洞** | PyPI 包(qwen-tts、soundfile)未来版本出现 CVE | 锁定版本号,定期执行 `pip-audit` 扫描 |
| **敏感内容处理** | 在不可信远程服务器上合成含密码/密钥的文本 | 纯本地模式处理敏感内容,远程模式仅限公开文本 |
| **资源耗尽** | 大文本合成导致 GPU OOM 或 CPU 长时间占满 | 分段合成长文本,监控进程资源占用 |

Qwen3-tts 内容

references文件夹
scripts文件夹
手动下载zip · 16.8 kB
README.mdtext/markdown
请选择文件