Text to Speech

🔊 AI语音合成,自然流畅可定制

基于HeyGen Starfish TTS模型,将文本转为高质量语音,支持音色选择、语速调节、音高控制及多语言本地化,适用于播客、配音等独立音频生成场景。

收藏
6.4k
安装
1.3k
版本
2.18.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Text-to-Speech (HeyGen Starfish) 是HeyGen自研的语音合成技能,专注于独立音频生成(非视频场景)。用户通过调用 /v1/audio 端点,将文本转换为自然流畅的语音输出。

主要功能

1. 语音列表获取:调用 mcp__heygen__list_audio_voices 或直接请求 GET /v1/audio/voices,获取支持Starfish TTS的完整音色库(含语言、性别、预览音频等元数据)
2. 语音合成:通过 mcp__heygen__text_to_speechPOST /v1/audio/text_to_speech 提交文本,支持以下参数:

3. SSML断句:支持 <break time="1.5s"/> 标签控制停顿节奏

  • 基础调节:语速(0.5-1.5倍)、音高(-50至50)
  • 多语言支持:locale 参数指定口音(如 en-USpt-BR
  • ElevenLabs高级设置:模型选择、相似度、稳定性、风格强度

响应特性

  • 返回可直接播放的 audio_url、音频时长 duration
  • 提供逐词时间戳 word_timestamps,便于字幕同步

显著优点

| 优势 | 说明 |
|------|------|
| **自研模型** | HeyGen Starfish为in-house TTS,非第三方依赖,可控性高 |
| **参数精细** | 语速/音高/口音多维调节,支持专业级音频定制 |
| **时间戳对齐** | 自动输出词级时间戳,降低后期剪辑成本 |
| **MCP工具链** | 提供标准化MCP工具封装,开发集成效率高 |
| **多语言覆盖** | 支持英语、中文、葡萄牙语等多种语言及本地化口音 |

潜在缺点与局限性

1. 音色库边界GET /v1/audio/voicesGET /v2/voices 为不同端点,部分视频可用音色不支持Starfish TTS,需显式筛选
2. 预览音频缺失:部分音色 preview_audio_url 为null,无法提前试听

3. ElevenLabs配置门槛:高级参数需理解TTS模型特性,普通用户上手成本较高

4. 断句标签限制:SSML break标签语法严格(需空格包围、秒级单位),格式错误将直接导致失败

5. API依赖风险:服务稳定性绑定HeyGen基础设施,无离线/本地部署选项

适合人群

  • 内容创作者:播客主播、有声书制作人、教育课程开发者
  • 产品团队:需要批量生成产品演示配音、IVR语音导航
  • 开发者:通过MCP工具快速集成TTS能力至自动化工作流
  • 多语言运营:跨境电商、国际化SaaS需本地化语音内容

常规风险

| 风险类型 | 具体表现 | 缓释建议 |
|----------|----------|----------|
| **成本累积** | 高频调用导致API费用上升 | 设置预算告警,缓存常用音频 |
| **内容合规** | 合成语音可能被滥用于虚假信息 | 建立内容审核机制,保留生成日志 |
| **授权隐患** | 商用场景需确认HeyGen授权条款 | 审阅服务条款,必要时购买企业许可 |
| **音频质量波动** | 极端参数(如speed<0.8或>1.2)导致语音 unnatural | 遵循最佳实践建议范围 |
| **密钥泄露** | `HEYGEN_API_KEY` 硬编码或泄露 | 使用环境变量+密钥管理服务,定期轮换 |

认证与工具建议

  • 必须配置HEYGEN_API_KEY 环境变量
  • 优先路径:存在 mcp__heygen__* 工具时,优先使用MCP而非直接HTTP调用
  • 调试技巧:利用返回的 request_id 追踪异常请求

Text to Speech 内容

手动下载zip · 3.5 kB
SKILL.mdtext/markdown
请选择文件