Text to Speech

🔊 专业级AI语音合成,精准时间戳控制

基于HeyGen Starfish TTS模型,支持多语言语音合成、语速音调调节、SSML停顿控制,返回带时间戳的高质量音频文件,适用于播客配音、有声读物等场景。

收藏
3.6k
安装
1.3k
版本
2.13.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

Text-to-Speech (HeyGen Starfish) 综合评估

核心用法

本技能基于HeyGen自研的Starfish TTS模型,提供独立的文本转语音能力。核心功能包括:

1. 语音合成:将文本转换为高质量音频文件,支持多语言(需通过list_audio_voices查询可用语音)
2. 参数精细控制

3. 高级功能:支持ElevenLabs集成模型参数(elevenlabs_settings),可微调相似度、稳定性和风格强度
4. SSML支持:通过<break time="Xs"/>标签实现精确的语音停顿控制

  • 语速调节:0.5-1.5倍速(建议0.8-1.2以保持自然)
  • 音调调整:-50至50整数值
  • 地域口音:通过locale参数(如en-USpt-BR)实现多语言语音的本地化发音

显著优点

  • 时间戳精度:返回word_timestamps字段,每个单词附带精确的起止时间(秒级),便于字幕同步和交互式音频应用
  • 企业级API设计:响应结构统一({error, data}),便于错误处理;支持MCP工具优先调用模式,降低集成复杂度
  • 多语言覆盖:支持多种语言和方言,且通过support_locale字段明确标识多语言能力
  • 音频预览机制preview_audio_url允许预听语音,降低试错成本
  • 灵活的调用方式:同时支持MCP工具和直接HTTP API,便于不同技术栈集成

潜在缺点与局限性

1. 语音池隔离:TTS专用语音(/v1/audio/voices)与视频语音(/v2/voices)不互通,用户需分别查询,易造成混淆
2. 预览音频缺失:部分语音的preview_audio_url可能为null,缺乏预听机制

3. 地域限制:仅特定多语言语音支持locale参数,需前置检查support_locale字段

4. SSML支持有限:仅支持break标签,复杂SSML功能(如音素标注、语调标记)未提及

5. 依赖外部API稳定性:HeyGen服务中断将直接影响本技能可用性

适合人群

  • 内容创作者:播客制作、YouTube配音、有声读物生产
  • 开发者:构建需要语音合成能力的应用(如客服机器人、教育软件、无障碍辅助工具)
  • 企业用户:需要品牌一致性的语音播报系统、IVR电话语音、培训材料配音
  • 多语言产品团队:需要快速生成本地化语音内容的国际化项目

常规风险

  • API密钥泄露HEYGEN_API_KEY需妥善保管,代码中硬编码密钥存在安全风险
  • 成本累积:按调用计费模式,长文本批量处理可能产生意外费用,需设置用量监控
  • 输出质量波动:极端语速(<0.8或>1.2)可能导致发音不自然或失真
  • 网络依赖:音频文件通过URL返回,需额外下载步骤,网络不稳定时可能获取失败
  • 合规风险:合成语音用于电话营销需遵守当地法规(如TCPA、GDPR语音数据条款)

Text to Speech 内容

手动下载zip · 3.5 kB
SKILL.mdtext/markdown
请选择文件