Qwen3 Audio

🎙️ Apple Silicon 专属语音 AI 引擎

Apple Silicon 专用高性能音频库,支持 TTS/STT/语音克隆,基于 Qwen3 模型优化,10+ 语言原生支持。

收藏
3.6k
安装
973
版本
0.1.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Qwen3-Audio 是一款专为 Apple Silicon(M1/M2/M3/M4)优化的音频处理技能,提供完整的语音 AI 能力栈:

1. 文本转语音 (TTS)

  • 基础 TTS:快速生成高质量语音输出
  • VoiceDesign:通过自然语言描述任意创建虚拟声音角色
  • CustomVoice:使用 9 种预设音色(Ryan/Aiden/Vivian 等),支持情绪指令控制
  • 语音克隆:3 秒参考音频即可复刻任意真人声线

2. 语音识别 (STT/ASR)

  • 支持多格式输出:txt/srt/ass
  • 内置测试音频验证功能

3. 声纹资产管理

  • 创建可复用的声纹档案(voice create
  • 自动管理 ref_audio/ref_text/ref_instruct

显著优点

  • Apple Silicon 原生优化:MLX 框架底层加速,推理效率极高
  • 多语言覆盖:中英日韩德法俄葡西意 10 种语言
  • 细粒度控制:情绪、风格、语速均可通过自然语言指令调节
  • 声纹即插即用:创建一次,多次复用,避免重复上传参考音频

潜在局限

  • 硬件锁定:仅限 Apple Silicon Mac,Intel Mac/Windows/Linux 无法运行
  • Python 版本限制:需 Python 3.10+
  • 模型体积:1.7B 参数模型对内存有一定要求
  • 方言支持有限:虽有北京/四川方言选项,但覆盖度不如标准语种

适合人群

  • 内容创作者(有声书、播客、视频配音)
  • 开发者构建语音交互应用
  • 需快速原型语音功能的 AI 产品团队
  • 对语音质量要求高且使用 Mac 的专业用户

常规风险

  • 声纹滥用风险:语音克隆能力需遵守当地法律法规,禁止伪造他人身份
  • 参考音频版权:用于克隆的音频需确保合法授权
  • 输出内容合规:TTS 生成的语音内容需符合平台政策
  • 环境依赖:需严格遵循 env-check-list 完成前置配置

Qwen3 Audio 内容

references文件夹
scripts文件夹
手动下载zip · 10.9 kB
env-check-list.mdtext/markdown
请选择文件