qwenspeak

🔊 Qwen3-TTS 容器化语音合成引擎

基于 Qwen3-TTS 的容器化语音合成服务,支持预设人声、情感控制、声音克隆与自定义声线设计,通过 SSH 安全通道异步执行 TTS 任务。

收藏
6.2k
安装
1.6k
版本
1.4.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

qwenspeak 是一个 YAML 驱动的文本转语音(TTS)解决方案,封装了阿里通义千问 Qwen3-TTS 模型,通过 SSH 隧道与锁定容器通信。用户通过 scripts/qwenspeak.sh 封装脚本提交异步作业,支持三种合成模式:

  • custom-voice:从 9 种预设说话人(中英日韩多语言)中选择,支持通过 instruct 字段注入情感/风格指令
  • voice-design:以自然语言描述目标声线(如"温暖友好的年轻女声"),仅 1.7B 模型支持
  • voice-clone:上传参考音频与转录文本,克隆特定说话人音色,支持 x_vector_only 快速声纹提取

作业采用异步队列机制,提交后立即返回 UUID,支持轮询状态、实时追踪日志 (-f)、取消任务及结果下载。YAML 配置支持三级参数继承(全局→步骤→生成),便于批量处理多角色多情绪场景。

显著优点

1. 多模态声线控制:业界罕见的"描述即声线"能力,无需训练即可通过自然语言设计全新音色
2. 情绪一致性方案:克隆模式下可通过上传不同情绪的参考音频,配合独立步骤实现情感可控合成

3. 工程化封装完善:SSH 命令白名单、路径沙箱(禁止目录遍历)、异步任务队列、自动清理机制,降低生产环境部署门槛

4. 硬件灵活:支持 0.6B/1.7B 模型切换,CPU/GPU 双端运行,可选 FlashAttention-2 加速

潜在局限

  • 基础设施依赖:必须预先部署容器并维护 SSH 长连接,单节点架构存在单点故障风险
  • 音频格式前置处理:参考音频需用户自行准备,无自动降噪/响度标准化提示
  • 语言支持盲区:预设说话人仅覆盖中英日韩,小语种需依赖 voice-design 或克隆,质量未明确
  • 作业生命周期短:容器重启即丢失历史任务,无持久化队列设计

适合人群

  • 需要批量生成多角色配音的游戏/动画/有声书制作团队
  • 追求声线可解释性控制(自然语言描述而非黑箱调参)的音频开发者
  • 已有容器化运维能力、愿自建 TTS 服务以规避云端 API 成本与隐私风险的技术组织

常规风险

  • SSH 密钥管理:生产环境需强制密钥认证、禁用密码登录,定期轮换密钥
  • 路径遍历防护:虽然沙箱已限制 /work 目录,但上传的参考音频可能含恶意触发器,建议隔离扫描
  • 模型输出合规:TTS 克隆功能存在深度伪造滥用风险,需在业务层实施说话人授权校验与输出水印标记
  • 资源争用:异步任务无优先级队列,大模型加载可能导致 GPU 显存 OOM,需监控 PROCESSING_UNIT 资源配额

qwenspeak 内容

scripts文件夹
手动下载zip · 4.1 kB
qwenspeak.shtext/x-shellscript
请选择文件