核心用法
Text-to-Speech (HeyGen Starfish) 是HeyGen自研的语音合成技能,专注于独立音频生成(非视频场景)。用户通过调用 /v1/audio 端点,将文本转换为自然流畅的语音输出。
主要功能
1. 语音列表获取:调用 mcp__heygen__list_audio_voices 或直接请求 GET /v1/audio/voices,获取支持Starfish TTS的完整音色库(含语言、性别、预览音频等元数据)
2. 语音合成:通过 mcp__heygen__text_to_speech 或 POST /v1/audio/text_to_speech 提交文本,支持以下参数:
3. SSML断句:支持 <break time="1.5s"/> 标签控制停顿节奏
- 基础调节:语速(0.5-1.5倍)、音高(-50至50)
- 多语言支持:
locale参数指定口音(如en-US、pt-BR) - ElevenLabs高级设置:模型选择、相似度、稳定性、风格强度
响应特性
- 返回可直接播放的
audio_url、音频时长duration - 提供逐词时间戳
word_timestamps,便于字幕同步
显著优点
| 优势 | 说明 |
|------|------|
| **自研模型** | HeyGen Starfish为in-house TTS,非第三方依赖,可控性高 |
| **参数精细** | 语速/音高/口音多维调节,支持专业级音频定制 |
| **时间戳对齐** | 自动输出词级时间戳,降低后期剪辑成本 |
| **MCP工具链** | 提供标准化MCP工具封装,开发集成效率高 |
| **多语言覆盖** | 支持英语、中文、葡萄牙语等多种语言及本地化口音 |
潜在缺点与局限性
1. 音色库边界:GET /v1/audio/voices 与 GET /v2/voices 为不同端点,部分视频可用音色不支持Starfish TTS,需显式筛选
2. 预览音频缺失:部分音色 preview_audio_url 为null,无法提前试听
3. ElevenLabs配置门槛:高级参数需理解TTS模型特性,普通用户上手成本较高
4. 断句标签限制:SSML break标签语法严格(需空格包围、秒级单位),格式错误将直接导致失败
5. API依赖风险:服务稳定性绑定HeyGen基础设施,无离线/本地部署选项
适合人群
- 内容创作者:播客主播、有声书制作人、教育课程开发者
- 产品团队:需要批量生成产品演示配音、IVR语音导航
- 开发者:通过MCP工具快速集成TTS能力至自动化工作流
- 多语言运营:跨境电商、国际化SaaS需本地化语音内容
常规风险
| 风险类型 | 具体表现 | 缓释建议 |
|----------|----------|----------|
| **成本累积** | 高频调用导致API费用上升 | 设置预算告警,缓存常用音频 |
| **内容合规** | 合成语音可能被滥用于虚假信息 | 建立内容审核机制,保留生成日志 |
| **授权隐患** | 商用场景需确认HeyGen授权条款 | 审阅服务条款,必要时购买企业许可 |
| **音频质量波动** | 极端参数(如speed<0.8或>1.2)导致语音 unnatural | 遵循最佳实践建议范围 |
| **密钥泄露** | `HEYGEN_API_KEY` 硬编码或泄露 | 使用环境变量+密钥管理服务,定期轮换 |
认证与工具建议
- 必须配置:
HEYGEN_API_KEY环境变量 - 优先路径:存在
mcp__heygen__*工具时,优先使用MCP而非直接HTTP调用 - 调试技巧:利用返回的
request_id追踪异常请求