核心功能
voice-message 是一个跨平台语音消息自动化工具,通过整合微软Edge-TTS语音合成与ffmpeg音频处理,实现文本到语音消息的一站式转换与投递。核心工作流分为三步:文本→OGG/Opus语音文件生成→渠道特定API调用。
显著优势
多平台深度适配:不仅提供通用asVoice=true方案(Telegram/WhatsApp/Signal),更针对飞书、Discord等平台开发了原生API对接脚本,解决asVoice参数不兼容导致的文件附件降级问题。飞书方案完整实现了tenant_access_token多账号管理、duration精确计算、audio消息类型等关键参数链,确保语音气泡正确渲染。
企业级飞书支持:独特价值在于飞书多租户架构适配——通过~/.openclaw/openclaw.json的accounts配置实现多Bot隔离,避免open_id cross app错误;严格区分opus上传与audio发送的API组合,杜绝文件附件误发送。
Discord语音消息完整实现:集成waveform波形生成(Python脚本计算Base64波形数据)与flags:8192标志位,符合Discord语音消息协议要求,避免50161错误。
局限与风险
外部依赖较重:依赖edge-tts(Python包)、ffmpeg/ffprobe系统二进制,部署环境需预装配置。
凭证管理复杂:飞书tenant_token需实时获取(2小时有效期),且多账号场景下需动态读取JSON配置,增加调用链路复杂度。
平台API耦合度高:飞书/Discord方案硬编码API路径与参数结构,平台接口变更将导致功能失效。
安全风险点:脚本涉及appSecret提取与curl明文传输,需确保openclaw.json文件权限管控;tenant_token缓存策略缺失,高频调用可能触发限流。
适用场景
- 多平台客服Bot语音消息推送
- 飞书企业工作流语音通知(需原生语音气泡体验)
- Discord社区自动化语音交互
建议
生产环境建议封装token缓存层,增加API降级策略(失败时转文件附件),并对openclaw.json实施600权限管控。