Voice Message

🎤 多平台语音消息一键发送专家

基于 edge-tts 和 ffmpeg 的多平台语音消息发送方案,特别解决飞书语音气泡兼容性问题,支持 Telegram、Discord、Signal、WhatsApp 等主流渠道

收藏
9.8k
安装
2.2k
版本
1.0.4
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能与架构

Voice Message 是一款专注于多平台语音消息发送的技能,通过整合微软 Edge TTS 引擎与 FFmpeg 音频处理工具,实现文本到语音的端到端转换与分发。

核心用法

语音生成:调用 scripts/gen_voice.sh 脚本,将文本转换为 Ogg/Opus 格式音频文件,支持中英文及多语言语音角色切换。

渠道分发

  • 通用渠道(Telegram、Signal、WhatsApp):直接通过 message 工具以 asVoice=true 参数发送
  • 飞书/ Lark:必须使用专用脚本 send_feishu_voice.sh,因官方 API 不原生支持 asVoice 参数,需手动处理音频上传与消息类型封装
  • Discord:需额外生成波形数据(waveform JSON),通过 API 直接发送并附加 IS_VOICE_MESSAGE 标志位

显著优点

1. 跨平台兼容性强:覆盖主流 IM 平台,针对性解决各平台 API 差异
2. TTS 质量可靠:基于微软 Edge 在线语音合成,中文 XiaoxiaoNeural 与英文 JennyNeural 音色自然

3. 格式标准统一:统一输出 Ogg/Opus,兼顾压缩率与兼容性

4. 飞书场景刚需:填补了飞书生态中语音消息发送的 tool gap,避免文件附件降级体验

潜在局限与风险

1. 外部依赖链长:需同时维护 edge-tts、ffmpeg、ffprobe 及 Python 环境,部署复杂度较高
2. 网络依赖:Edge TTS 为在线服务,离线环境不可用且存在 API 变更风险

3. Token 管理成本:飞书需自行获取并维护 tenant_access_token,增加运维负担

4. Discord 集成复杂:需额外 Python 脚本处理波形生成,非开箱即用

5. 错误处理薄弱:文档未提及失败重试、语音生成异常等边界情况

适合人群

  • 需在飞书工作流中自动化发送语音通知的开发者/运维团队
  • 构建多平台客服机器人或通知系统的技术团队
  • 已有 ffmpeg 基础环境,追求 TTS 音质的语音应用场景

常规风险提示

  • 语音内容可能因平台审核策略被拦截,建议配合敏感词过滤
  • 高频调用 Edge TTS 可能触发微软速率限制
  • 飞书 token 需安全存储,避免硬编码泄露

Voice Message 内容

references文件夹
scripts文件夹
手动下载zip · 5.7 kB
voices.mdtext/markdown
请选择文件