核心用法
Text-to-Speech (HeyGen Starfish) 是 HeyGen 官方提供的文本转语音技能,基于自研 Starfish TTS 模型生成高质量语音音频。主要工作流为三步:首先调用 mcp__heygen__list_audio_voices 获取支持的音色列表,筛选符合语言、性别需求的音色;随后通过 mcp__heygen__text_to_speech 提交文本及参数(voice_id、speed、pitch、locale 等);最后获取返回的 audio_url 下载或播放音频。
显著优点
1. 音色丰富度:支持按语言、性别筛选,提供预览音频,便于精准匹配场景需求
2. 参数精细化:语速 0.5-1.5 倍可调,音调 -50 至 +50 级调节,支持多语言口音(locale)切换
3. 高级功能:内置 ElevenLabs 集成接口,可调用第三方高级模型;返回 word_timestamps 支持字幕同步
4. 开发友好:同时提供 MCP 工具封装与原生 REST API,附带 TypeScript/Python 完整示例代码
潜在缺点与局限性
- 端点隔离:TTS 专用音色端点(/v1/audio/voices)与视频端点(/v2/voices)不互通,部分视频音色无法用于 TTS
- API 依赖:需 HEYGEN_API_KEY 环境变量,国内访问可能存在网络延迟
- 成本因素:HeyGen 商业 API 按用量计费,高频调用需关注账单
- 预览限制:部分音色 preview_audio_url 为 null,需盲选或多次测试
适合人群
- 播客/有声书创作者需批量生成旁白音频
- 开发者构建语音交互应用、自动客服系统
- 内容本地化团队需多语言语音输出
- 营销团队快速制作产品演示语音素材
常规风险
- 密钥泄露:HEYGEN_API_KEY 需妥善保管,避免硬编码提交至代码仓库
- 内容合规:生成内容需遵守 HeyGen 使用条款,禁止生成虚假身份语音用于欺诈
- 输出质量波动:极端语速(<0.8 或 >1.2)可能导致发音不自然
- SSML 解析:break 标签需严格遵循格式(空格包围、秒为单位),否则被当作普通文本输出