qwenspeak

🗣️ 私有化语音合成工作站

基于阿里Qwen3-TTS的语音合成工具,支持9种预设音色、语音克隆与自然语言声音设计,通过SSH安全容器隔离执行

收藏
6.2k
安装
1.6k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

qwenspeak 是一个将阿里云 Qwen3-TTS 文本转语音模型封装在 SSH 沙箱容器中的技能。用户通过 SSH 命令与容器交互,执行语音合成任务。核心功能分为三类:

1. 预设音色合成tts custom-voice):9 种跨语言预设声音,支持情绪控制(1.7B 模型)
2. 声音设计tts voice-design):用自然语言描述期望的音色特征生成语音

3. 语音克隆tts voice-clone):上传参考音频克隆任意人声,支持 ICL(带转录)和 x-vector(纯声纹)两种模式

文件操作通过受限命令(put/get/ls/rm 等)完成,所有路径锁定在容器内 /work 目录。

显著优点

  • 安全隔离:强制 SSH 密钥认证、无 shell 访问、命令白名单过滤、禁止管道和特殊字符注入
  • 模型能力强大:Qwen3-TTS 支持 10 种语言,克隆质量高,情绪可控
  • 零本地依赖:完全云端/容器化运行,仅需 SSH 客户端
  • 灵活部署:支持 0.6B 轻量模型和 1.7B 完整模型,可选 CPU/GPU 推理

潜在缺点与局限

  • 部署门槛:需自行搭建 Docker 容器并暴露 SSH 服务,配置复杂度较高
  • 无实时试听:需下载 WAV 文件后本地播放,交互流程繁琐
  • 中文资源集中:预设音色以中文为主,英文仅 2 种,其他语言依赖克隆
  • 网络依赖:所有操作需稳定 SSH 连接,大文件传输受带宽限制

适合人群

  • 需要私有化 TTS 部署的开发者与企业(避免公有 API 的数据出境顾虑)
  • 内容创作者 needing 多语言克隆与情绪控制
  • 对 AI 语音安全隔离有硬性要求的敏感场景

常规风险

  • 主机密钥管理:首次连接需手动确认指纹,存在中间人攻击窗口期
  • 容器逃逸:尽管白名单严格,Docker 权限配置不当仍可能导致宿主机暴露
  • 语音伪造滥用:克隆功能可被用于深度伪造,需配合使用方合规审查
  • 数据残留:容器内 /work 文件需手动清理,存在隐私数据泄露风险

qwenspeak 内容

手动下载zip · 3.4 kB
SKILL.mdtext/markdown
请选择文件