核心用法
tts 是一款功能全面的文本转语音(TTS)技能,提供双后端架构满足不同场景需求:
1. 简单模式(快速语音合成)
- 基础用法:
tts.py -t "文本内容" -o 输出.mp3 - 支持文件输入、多种音频格式(MP3/WAV/OPUS/OGG)
- 可通过
--ref-audio实现声音克隆(本地文件或URL)
2. 时间轴模式(精准配音)
- SRT生成:自动将长文本按语速切割为字幕格式
- 语音映射(Voice Map):JSON配置文件支持逐片段指定音色、语速、语言、情绪
- 动态参考音频:
--ref-audio-track可从原视频自动截取对应时段音频作为克隆参考 - 渲染输出:通过
ffmpeg精确拼接,实现口型同步级配音
3. 后端选择策略
| 需求场景 | 推荐后端 |
|---------|---------|
| 快速朗读、离线使用 | Kokoro(本地) |
| EPUB/PDF有声书、多音色混合 | Kokoro |
| 声音克隆、情绪控制、精确时长 | Noiz(云端) |
4. 访客模式
无API密钥时自动降级,支持15种预设音色,但禁用克隆、情绪、时间轴渲染等高级功能。
显著优点
- 双引擎灵活切换:本地隐私优先 vs 云端效果优先
- 专业级时间轴控制:SRT驱动的精准音频对齐,适合影视配音
- 零配置声音克隆:参考音频支持本地路径或URL,一键克隆任意声音
- 情绪维度精细调节:Noiz后端支持Joy/Calm等情绪强度参数
- 多语言无缝切换:中英文及日语支持,单文件内可混排
潜在局限
- 云端依赖:Noiz高级功能需网络及API密钥,存在服务可用性风险
- 隐私考量:Noiz后端需上传文本及参考音频至第三方服务器
- 本地资源占用:Kokoro需本地模型运行,大文本合成可能占用显著内存
- ffmpeg依赖:时间轴模式需外部工具,Windows环境配置较复杂
适合人群
- 内容创作者(短视频配音、有声书制作)
- 影视后期制作(多角色自动配音、口型同步)
- 无障碍服务开发者(屏幕阅读、辅助语音)
- 多语言内容本地化团队
常规风险
- API密钥泄露:存储于
~/.config/noiz/api_key,需确保权限0600 - 参考音频版权:克隆他人声音需获得合法授权
- 云端数据留存:Noiz服务端可能临时存储合成请求
- 合成内容合规:生成的语音内容需符合平台政策及法律法规
- 临时文件清理:异常中断可能导致
/tmp残留音频片段