tts

🔊 AI语音合成 · 克隆配音专家

专业级文本转语音工具,支持本地Kokoro与云端Noiz双后端,可实现声音克隆、情绪控制与精准时间轴配音。

收藏
4k
安装
1.2k
版本
1.0.2
CLS 安全性认证2026-08-03
点击查看完整报告 >

使用说明

核心用法

tts 是一款功能全面的文本转语音(TTS)技能,提供双后端架构满足不同场景需求:

1. 简单模式(快速语音合成)

  • 基础用法:tts.py -t "文本内容" -o 输出.mp3
  • 支持文件输入、多种音频格式(MP3/WAV/OPUS/OGG)
  • 可通过 --ref-audio 实现声音克隆(本地文件或URL)

2. 时间轴模式(精准配音)

  • SRT生成:自动将长文本按语速切割为字幕格式
  • 语音映射(Voice Map):JSON配置文件支持逐片段指定音色、语速、语言、情绪
  • 动态参考音频--ref-audio-track 可从原视频自动截取对应时段音频作为克隆参考
  • 渲染输出:通过 ffmpeg 精确拼接,实现口型同步级配音

3. 后端选择策略

| 需求场景 | 推荐后端 |
|---------|---------|
| 快速朗读、离线使用 | Kokoro(本地) |
| EPUB/PDF有声书、多音色混合 | Kokoro |
| 声音克隆、情绪控制、精确时长 | Noiz(云端) |

4. 访客模式
无API密钥时自动降级,支持15种预设音色,但禁用克隆、情绪、时间轴渲染等高级功能。

显著优点

  • 双引擎灵活切换:本地隐私优先 vs 云端效果优先
  • 专业级时间轴控制:SRT驱动的精准音频对齐,适合影视配音
  • 零配置声音克隆:参考音频支持本地路径或URL,一键克隆任意声音
  • 情绪维度精细调节:Noiz后端支持Joy/Calm等情绪强度参数
  • 多语言无缝切换:中英文及日语支持,单文件内可混排

潜在局限

  • 云端依赖:Noiz高级功能需网络及API密钥,存在服务可用性风险
  • 隐私考量:Noiz后端需上传文本及参考音频至第三方服务器
  • 本地资源占用:Kokoro需本地模型运行,大文本合成可能占用显著内存
  • ffmpeg依赖:时间轴模式需外部工具,Windows环境配置较复杂

适合人群

  • 内容创作者(短视频配音、有声书制作)
  • 影视后期制作(多角色自动配音、口型同步)
  • 无障碍服务开发者(屏幕阅读、辅助语音)
  • 多语言内容本地化团队

常规风险

  • API密钥泄露:存储于 ~/.config/noiz/api_key,需确保权限 0600
  • 参考音频版权:克隆他人声音需获得合法授权
  • 云端数据留存:Noiz服务端可能临时存储合成请求
  • 合成内容合规:生成的语音内容需符合平台政策及法律法规
  • 临时文件清理:异常中断可能导致 /tmp 残留音频片段

安全解读

核心用法

本TTS技能提供两套完整的工作流:Simple模式适用于快速文本转语音,通过speak子命令(可省略)直接生成音频,支持从文件读取、语音克隆(本地文件或URL)、以及多种输出格式(MP3、OPUS、OGG等)。Timeline模式则专为专业配音场景设计,需先将文本转换为SRT字幕文件,再创建JSON格式的声线映射(voice map)控制每段的音色、语速、语言甚至情感参数,最终通过render命令生成时间轴精准对齐的音频。

后端选择方面,Kokoro为完全离线的本地引擎,适合隐私敏感内容;Noiz为云端服务,提供情感控制(emo参数)、精确时长控制和真人级语音克隆能力,无API Key时自动降级为Guest模式(15种内置音色,功能受限)。

显著优点

1. 双后端灵活架构:本地Kokoro保障数据隐私,云端Noiz提供商业级音质,用户可按场景自由切换
2. 专业级配音能力:时间轴渲染模式支持SRT导入、逐片段声线映射、动态参考音频切片,满足影视配音、有声书制作等专业需求

3. 零门槛Guest模式:无需注册即可体验15种跨语种高质量音色(中/英/日)

4. 精细化情感控制:Noiz后端支持Joy、Calm等情绪参数调节,超越传统TTS的机械感

5. 完善的第三方集成:内置Feishu、Telegram、Discord等平台的语音消息格式支持

潜在缺点与局限性

1. 功能分散门槛高:双后端、双模式的设计虽灵活,但参数体系差异大(如Kokoro用voice,Noiz用voice_id/emo),新手易产生混淆
2. 云端依赖的隐私权衡:Noiz的情感控制、语音克隆等核心亮点功能必须上传数据至云端,无法本地完成

3. Guest模式功能受限:无API Key时无法使用语音克隆、时间轴渲染、情感控制等高级功能

4. ffmpeg依赖:时间轴模式需要外部ffmpeg工具链,增加了部署复杂度

5. 语言支持不均衡:Kokoro的中文音色丰富,但Noiz的Guest模式仅提供有限的日文和中文选项

适合的目标群体

  • 内容创作者:需要将文章、EPUB、PDF快速转换为有声内容的主播、博主
  • 影视后期工作者:需要精确时间轴对齐的多角色配音、字幕同步制作
  • 隐私敏感用户:选择Kokoro后端处理机密文档、个人日记等内容的用户
  • 多语言项目团队:需要中/英/日三语统一声线风格的企业培训、国际化产品
  • 技术爱好者:希望深度定制声线映射、探索语音克隆边界的开发者

常规使用风险

性能风险:Noiz云端合成受网络延迟影响,长文本可能触发超时;Kokoro本地运行则依赖设备算力,大规模批处理需预留足够资源。

依赖项风险:时间轴模式强制依赖ffmpeg,若系统PATH配置不当或版本不兼容会导致渲染失败;requests库未预装时会阻断Noiz后端功能。

数据残留风险:虽然临时文件清理机制完善,但在异常中断(如强制终止进程)情况下,/tmp目录可能残留音频片段。

API配额风险:Noiz免费额度耗尽后服务将中断,需关注用量或准备备用后端方案。

声权合规风险:语音克隆功能需确保对参考音频拥有合法使用权,避免侵犯他人声音权益。

tts 内容

scripts文件夹
手动下载zip · 21.9 kB
noiz_tts.pytext/plain
请选择文件