tts

🔊 文本秒变语音,配音精准可控

文本转语音神器,支持本地Kokoro与云端Noiz双后端,涵盖简单朗读、SRT精准对齐、声纹克隆与情绪控制,满足播客、配音、有声书多场景需求。

收藏
4.2k
安装
1.2k
版本
1.0.1
CLS 安全性认证2026-08-03
点击查看完整报告 >

使用说明

核心用法

本技能提供双模式文本转语音能力:

简单模式:一键将文本转换为音频,支持文件输入、语音克隆(通过参考音频)、多种输出格式(MP3/WAV/OPUS/OGG)。适合快速朗读、消息播报等场景。

时间轴模式:专为配音、字幕对齐设计的三步工作流:
1. 文本→SRT:自动按语速(CPS)生成字幕文件

2. 声图映射:JSON配置支持分段声线、语速、情绪、语言切换

3. 精准渲染:严格按SRT时间轴输出,可选动态参考音频切片实现"原视频声纹翻译"

双后端策略

  • Kokoro(本地):零成本、支持声线融合(v1:60,v2:40)、EPUB/PDF原生支持
  • Noiz(云端):支持情绪参数(emo)、精确时长控制、高质量声纹克隆

Guest模式:无API key时自动降级,15种预置声线可用,覆盖中/日/英三语。

显著优点

  • 场景覆盖极全:从一句话播报到多角色有声书制作
  • 声线控制精细:支持分段级语速、情绪、语言切换
  • 配音工作流完整:SRT生成→声图配置→时间轴渲染闭环
  • 零门槛入门:Guest模式无需注册即可体验

潜在局限

  • 时间轴模式依赖ffmpeg,增加环境复杂度
  • Noiz高级功能(情绪/克隆/精确时长)需付费API key
  • 声纹克隆质量受参考音频质量影响,无自动降噪提示
  • 双后端能力差异大,用户需记忆「何时选哪个」决策表

适合人群

  • 内容创作者:播客、短视频配音、AI有声书制作
  • 本地化团队:多语言视频翻译与口型同步
  • 无障碍需求者:EPUB/PDF转语音阅读
  • 开发者:Feishu/Telegram/Discord bot集成

常规风险

  • 声纹滥用:reference_audio支持URL直传,存在盗用他人声纹风险
  • API密钥管理:base64 key需严格保管,文档已强调无Bearer前缀要求
  • 版权内容:EPUB/PDF转换需注意原文版权授权
  • 云端依赖:Noiz后端受网络与服务商稳定性影响

安全解读

核心用法

该 TTS 技能提供两种运行模式满足差异化需求。简易模式适用于快速文本转语音,支持直接输入文本或读取文件,可指定输出格式(MP3、WAV、OPUS、OGG),并支持通过参考音频进行音色克隆。时间轴模式专为专业配音场景设计,需配合 SRT 字幕文件与语音映射配置(voice map),实现逐句精准对齐、多角色分轨配音及动态参考音频切片,适用于影视译制、有声书制作等高精度场景。

后端选择策略清晰:Kokoro 作为默认本地引擎,适合无网络环境、EPUB/PDF 章节化有声书生成及音色混合需求;Noiz 云端引擎则独占情感参数控制(emo)、高精度时长对齐与高级语音克隆能力,是专业配音的唯一完整解决方案。Guest 模式在缺失 API 密钥时自动启用,提供 15 种预置音色(覆盖中日英三语)的有限功能访问。

显著优点

架构灵活性是该技能的核心竞争力。双后端设计让用户在隐私优先(本地)与功能完整(云端)之间自由权衡,而非被迫妥协。语音映射的 JSON 配置直观支持单句索引与区间批量设置,大幅降低多角色项目复杂度。动态参考音频切片功能允许直接绑定原始视频音轨,实现翻译配音时的口型与语气同步还原。

安全设计到位。API 密钥采用 XDG 规范存储于 ~/.config/noiz/api_key,文件权限严格限制为 600,支持环境变量覆盖与旧配置自动迁移。所有网络传输强制 HTTPS,文本数据仅发送至 noiz.ai 官方端点,无第三方数据外泄。代码审计显示无 eval/exec 动态执行、无提示词投毒、无权限升级诱导路径。

输出生态完善。原生支持 OPUS/OGG 语音消息格式,无缝对接飞书、Telegram、Discord 等即时通讯平台;时间轴模式生成的音频可直接嵌入视频工作流,减少后期制作环节。

潜在缺点与局限性

功能割裂是用户体验的主要摩擦点。语音克隆、情感控制、精确时长三大专业功能被 Noiz 独占,Kokoro 用户无法本地获得同等能力;反之,音色混合又是 Kokoro 独有。用户需在后端切换中记忆能力边界,增加了认知负担。

依赖管理存在门槛。时间轴模式强制要求系统安装 ffmpeg,Noiz 后端依赖 Python requests 库,本地 Kokoro 需单独安装 kokoro-tts 工具。尽管依赖精简,但跨平台环境配置仍可能阻碍非技术用户。

Guest 模式功能裁剪严重。15 种预置音色虽覆盖基础语种,但移除克隆、情感、时长控制及时间轴渲染能力,仅适合临时体验,无法支撑生产环境。中文音色命名采用「悦悦」「婉青」等拟人化标签,虽亲切但缺乏技术参数描述(如采样率、情感基线),增加选型试错成本。

网络传输的隐私权衡。即使采用 Noiz 后端,用户文本仍需离境处理;虽可通过 --backend kokoro 切换本地引擎规避,但该选项需在每次调用时显式指定,缺乏持久化配置机制。

适合的目标群体

  • 有声书/播客创作者:需批量将 EPUB、PDF、长文转换为章节化音频
  • 影视翻译与本地化团队:依赖 SRT 时间轴对齐实现精准配音
  • 多角色内容生产者:利用 voice map 管理复杂角色的音色分配
  • 即时通讯运营者:快速生成 OPUS/OGG 格式语音消息
  • 隐私敏感型用户:可选择 Kokoro 后端实现完全本地化处理

使用风险

性能层面:Noiz 云端合成受网络延迟与 API 配额限制,批量任务可能出现速率瓶颈;本地 Kokoro 虽无网络依赖,但大规模文本处理对计算资源有一定要求。

依赖项风险ffmpeg 版本差异可能导致时间轴渲染异常,建议使用 4.4+ 版本;kokoro-tts 若通过非官方渠道安装,存在供应链污染可能。

数据合规:虽通过 GDPR 最小化原则审计,但医疗、金融等强监管场景下,文本离境仍需额外合规评估。

密钥管理:文件存储模式存在被其他进程读取的理论风险,高安全环境建议改用 NOIZ_API_KEY 环境变量方案。

tts 内容

scripts文件夹
手动下载zip · 21.0 kB
noiz_tts.pytext/plain
请选择文件