Text To Speech

🔊 多模型 AI 语音合成,一键生成自然表达

通过 inference.sh CLI 调用多模型(Kokoro、DIA、VibeVoice 等)实现文本转语音,支持对话式、情感化、播客长音频及语音克隆,适用于旁白、有声书、IVR 等场景。

收藏
7.7k
安装
2.6k
版本
0.1.5
CLS 安全扫描中
预计需要 3 分钟...

使用说明

概述

Text-to-Speech 技能基于 inference.sh 平台,提供命令行工具(infsh)调用多款先进 TTS 模型,将文本转换为自然语音。集成模型涵盖 Kokoro TTS(快速自然)、DIA TTS(对话式表达)、VibeVoice(播客长音频)、Higgs Audio(情感控制)及 Chatterbox(通用场景),满足不同应用需求。

核心用法

安装 CLI 后,通过 infsh app run <app-id> 执行推理,支持 JSON 参数配置文本、音色、情感等。典型流程:
1. 安装并登录:curl -fsSL https://cli.inference.sh | sh && infsh login

2. 运行模型:infsh app run infsh/kokoro-tts --input '{"text": "内容"}'

3. 复杂配置:使用 infsh app sample 生成模板,编辑后提交

显著优点

  • 多模型选择:5+ 专业模型覆盖从快速 TTS 到情感化播客生成
  • 高级特性:支持多说话人对话、语音克隆、情感参数调节
  • 生态整合:可与 OmniHuman 等视频生成模型联动,实现"语音+数字人"工作流
  • 便捷 CLI:单命令安装,SHA-256 校验,无需 root 权限

局限性与风险

  • 平台依赖:必须注册 inference.sh 账号,受平台服务可用性制约
  • 成本模型:基于云端 API 调用,高频使用产生费用(具体定价需查阅平台)
  • 语音克隆合规:未明确提及授权验证,商业使用需注意肖像权与版权
  • 网络要求:纯云端推理,需稳定网络,不支持离线

适合人群

内容创作者(视频旁白、播客)、开发者(构建语音交互应用)、无障碍需求场景(视障辅助)、企业 IVR 系统集成者。

常规风险

  • 生成内容需符合平台 AUP(可接受使用政策)
  • 语音克隆技术存在深度伪造滥用风险
  • 长音频生成任务可能因队列延迟失败,建议实现重试机制

Text To Speech 内容

手动下载zip · 3.2 kB
skill-card.mdtext/markdown
请选择文件