FlowVoice — Clone Any Voice From a Short Audio Sample

🎙️ 本地极速语音克隆,一键生成专属配音

基于 LuxTTS 的本地语音克隆工具,3秒样本即可复制任意人声,150倍实时合成,无需云端API,支持CPU/MPS运行。

收藏
3k
安装
994
版本
1.0.2
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

FlowVoice 是一款基于 LuxTTS(ZipVoice 架构)的本地语音克隆工具,允许用户通过 3-30 秒的音频样本克隆任意人声,并生成高质量语音输出。其核心工作流分为三步:

1. 语音克隆clone.py 从音频样本提取声纹特征,保存为 .pkl 配置文件
2. 语音生成speak.py 调用已保存的配置文件,将文本转换为语音(48kHz WAV)

3. 视频合成:可选通过 ffmpeg 将生成的语音直接嵌入视频

支持一键式 flow_voice.py 脚本,实现"克隆+生成"单次完成。提供语速调节(--speed)、平滑降噪(--smooth)、推理步数控制(--steps)等高级参数。

显著优点

  • 完全本地化:无需 API Key,无云端依赖,零使用成本
  • 硬件友好:1GB VRAM 即可运行,支持 CPU 和 Apple Silicon MPS(自动检测)
  • 极速推理:150倍实时速度,生成长文本几乎无等待
  • 输出质量高:48kHz 采样率,支持 --smooth 参数消除金属感伪影
  • 工作流整合:原生支持视频配音,可直接为动画添加语音旁白

潜在缺点与局限性

  • 样本质量敏感:需要干净、无背景音乐的音频,嘈杂样本会显著降低克隆效果
  • 最低时长要求:至少 3 秒有效音频,10-30 秒才能达到理想效果
  • 首次启动延迟:需下载约 200MB 模型文件至 HuggingFace 缓存
  • 中文支持存疑:LuxTTS 基于英文数据集训练,中文语音合成效果未经明确验证
  • 伦理风险:缺乏内置的声纹水印或来源验证机制

适合人群

  • 需要为视频、动画快速生成旁白的创作者
  • 注重隐私、拒绝云端语音服务的用户
  • Apple Silicon 用户(MPS 加速优化良好)
  • 低配置设备用户(CPU 模式可运行)

常规风险

  • 深度伪造滥用:技术门槛低,可能被用于生成虚假音频内容
  • 版权与肖像权:克隆他人声音可能涉及法律风险,需获得明确授权
  • 模型来源:依赖社区维护的 LuxTTS,长期更新和支持稳定性不确定
  • 输出目录权限:默认写入 ~/clawd/output/voice/,需确保路径权限正确

FlowVoice — Clone Any Voice From a Short Audio Sample 内容

scripts文件夹
手动下载zip · 5.4 kB
flow_voice.pytext/plain
请选择文件