核心用法
Voice Message 是一款跨平台语音消息发送工具,集成 Microsoft Edge TTS 与 FFmpeg,实现文本到语音的自动化转换与分发。
功能流程:
1. 语音生成:通过 edge-tts 将文本转换为 OGG/Opus 格式音频,支持多语言语音选择(中文默认 zh-CN-XiaoxiaoNeural,英文默认 en-US-JennyNeural)
2. 渠道适配:
- 通用渠道(Telegram、Signal、WhatsApp 等):直接调用
message工具,设置asVoice=true即可发送语音气泡 - 飞书/Lark:关键限制——飞书不支持
asVoice=true,必须通过原生 API 分两步(上传+发送),且需严格设置file_type=opus+msg_type=audio,否则降级为文件附件 - Discord:需额外生成波形数据(waveform),设置
flags=8192(IS_VOICE_MESSAGE),否则报错 50161
多账号支持:飞书配置支持多账号场景,需根据当前 agent 名称从 ~/.openclaw/openclaw.json 中提取对应凭证,避免 99992361 open_id cross app 错误。
显著优点
- 跨平台统一接口:一套文本输入,自动适配多平台语音消息格式
- 高质量语音合成:基于微软 Edge TTS,支持 100+ 种语言和语音风格
- 原生体验保障:飞书、Discord 等平台的特殊处理确保语音气泡而非文件附件
- 企业级多账号:支持多飞书应用配置,适配复杂组织架构
潜在缺点与局限性
- 配置复杂度高:飞书需手动获取
tenant_access_token,Discord 需额外生成波形 - 依赖外部工具:必须预装
edge-tts、ffmpeg、ffprobe,Windows 环境配置较繁琐 - 平台差异大:各渠道实现机制不统一,维护成本较高
- 无实时语音:仅支持预生成音频文件,非实时语音通话
适合人群
- 运维/开发者需要向 IM 渠道发送语音告警或通知
- 客服团队希望自动化语音消息推送
- 多平台运营者需统一管理 Telegram、飞书、Discord 等渠道
常规风险
- 凭证泄露风险:
tenant_access_token、BOT_TOKEN需妥善保管 - API 调用限制:飞书、Discord 均有频率限制,高频场景需控制速率
- 格式兼容问题:Opus 编码参数不当可能导致部分客户端无法播放