核心用法
feishu-voice 是一个自动化语音消息发送技能,主要解决飞书 IM 场景下的 TTS 语音合成与格式兼容问题。核心流程为:Edge TTS 生成 MP3 → ffmpeg 转码为 Opus(飞书音频标准格式)→ 飞书 API 上传获取 file_key → 以 msg_type=audio 发送语音气泡消息。
触发条件:用户明确要求"语音回复""发语音消息""TTS 朗读"时自动调用。
关键约束:必须使用 audio 消息类型而非普通文件上传,否则消息显示为附件而非可播放的语音气泡。
显著优点
1. 零成本无限调用:依赖微软 Edge TTS(基于 Azure 认知服务),完全免费且无次数限制,相比百度/讯飞等商用 API 节省大量成本。
2. 格式全自动处理:内置 ffmpeg 转码流水线,用户无需手动处理音频格式兼容问题。
3. 音色丰富可扩展:默认"云希"(活泼阳光男声),支持 10+ 中文音色,通过 --voice 参数快速切换,覆盖客服、播报、娱乐等多场景。
4. 原生飞书集成:直接复用 openclaw.json 中的飞书应用凭证,无需额外配置。
潜在局限与风险
| 风险点 | 说明 |
|--------|------|
| 外部依赖稳定性 | Edge TTS 为微软服务,存在网络延迟或政策变更风险 |
| 音频质量上限 | 免费版音质 24kHz,略低于商用 TTS 的高清版本 |
| 隐私合规 | 文本内容需经过微软服务器处理,敏感内容需谨慎 |
| 系统依赖 | 要求预装 ffmpeg,部分精简环境需手动部署 |
适合人群
- 企业运营/客服团队:需批量发送语音通知但预算有限
- 开发者:构建飞书机器人时的低成本 TTS 方案
- 个人效率用户:偏好语音消息交互场景
安全等级说明
需访问外部网络(Edge TTS API)及飞书开放 API,数据经第三方服务器处理,故安全评级为 A(可控风险)。建议对敏感内容启用本地 TTS 备选方案。