Voice Message

🎤 多平台语音消息一键发送专家

基于 edge-tts 和 ffmpeg 的多平台语音消息发送方案,特别解决飞书语音气泡兼容性问题,支持 Telegram、Discord、Signal、WhatsApp 等主流渠道

收藏
9.8k
安装
2.2k
版本
1.0.4
CLS 安全性认证2026-08-04
点击查看完整报告 >

使用说明

核心功能与架构

Voice Message 是一款专注于多平台语音消息发送的技能,通过整合微软 Edge TTS 引擎与 FFmpeg 音频处理工具,实现文本到语音的端到端转换与分发。

核心用法

语音生成:调用 scripts/gen_voice.sh 脚本,将文本转换为 Ogg/Opus 格式音频文件,支持中英文及多语言语音角色切换。

渠道分发

  • 通用渠道(Telegram、Signal、WhatsApp):直接通过 message 工具以 asVoice=true 参数发送
  • 飞书/ Lark:必须使用专用脚本 send_feishu_voice.sh,因官方 API 不原生支持 asVoice 参数,需手动处理音频上传与消息类型封装
  • Discord:需额外生成波形数据(waveform JSON),通过 API 直接发送并附加 IS_VOICE_MESSAGE 标志位

显著优点

1. 跨平台兼容性强:覆盖主流 IM 平台,针对性解决各平台 API 差异
2. TTS 质量可靠:基于微软 Edge 在线语音合成,中文 XiaoxiaoNeural 与英文 JennyNeural 音色自然

3. 格式标准统一:统一输出 Ogg/Opus,兼顾压缩率与兼容性

4. 飞书场景刚需:填补了飞书生态中语音消息发送的 tool gap,避免文件附件降级体验

潜在局限与风险

1. 外部依赖链长:需同时维护 edge-tts、ffmpeg、ffprobe 及 Python 环境,部署复杂度较高
2. 网络依赖:Edge TTS 为在线服务,离线环境不可用且存在 API 变更风险

3. Token 管理成本:飞书需自行获取并维护 tenant_access_token,增加运维负担

4. Discord 集成复杂:需额外 Python 脚本处理波形生成,非开箱即用

5. 错误处理薄弱:文档未提及失败重试、语音生成异常等边界情况

适合人群

  • 需在飞书工作流中自动化发送语音通知的开发者/运维团队
  • 构建多平台客服机器人或通知系统的技术团队
  • 已有 ffmpeg 基础环境,追求 TTS 音质的语音应用场景

常规风险提示

  • 语音内容可能因平台审核策略被拦截,建议配合敏感词过滤
  • 高频调用 Edge TTS 可能触发微软速率限制
  • 飞书 token 需安全存储,避免硬编码泄露

安全解读

核心用法

Voice Message Skill 是一套多平台语音消息自动化解决方案,通过 edge-tts 实现文本转语音,借助 ffmpeg 完成音频格式转换,最终适配各聊天平台的 API 特性完成发送。整个流程分为两步:首先调用 scripts/gen_voice.sh 生成 Ogg/Opus 格式的语音文件,支持自定义语音角色(中文默认 zh-CN-XiaoxiaoNeural,英文默认 en-US-JennyNeural);随后根据目标平台选择对应的发送方式——Telegram/Signal/WhatsApp 等可直接使用 message 工具的 asVoice=true 参数,飞书必须使用专用脚本 scripts/send_feishu_voice.sh 上传并发送语音气泡,Discord 则需额外生成波形数据并通过 API 携带 flags: 8192 标识。

显著优点

平台适配深度:针对飞书的特殊限制(message 工具 asVoice=true 无效)提供了原生语音气泡解决方案,通过上传 opus 文件并指定 audio 消息类型实现真正的语音消息效果,这是其他通用工具难以覆盖的痛点。

语音质量保障:依托 Microsoft Edge TTS 的神经网络语音合成技术,支持 100+ 种语言变体,发音自然度远超传统 TTS 方案,且完全免费。

架构轻量透明:仅依赖系统级工具(edge-tts、ffmpeg),无复杂运行时环境,代码总量约 200 行,易于审计和定制。

安全实践合规:敏感凭证(飞书 tenant_access_token)通过参数传入,无硬编码密钥风险,符合最小权限原则。

潜在缺点与局限性

外部服务依赖:核心功能依赖 Microsoft 在线 TTS 服务,需保持外网连通性,且文本内容需上传至 Microsoft 服务器处理,存在数据跨境传输合规考量。

飞书配置门槛:需自行申请飞书开放平台应用、获取 tenant_access_token,对非技术用户有一定上手成本。

Discord 复杂度:需额外执行 Python 脚本生成波形数据,流程相对繁琐。

音频格式限制:输出固定为 Ogg/Opus 格式,部分老旧平台可能不支持播放。

无实时能力:为异步批处理模式,不适合实时语音对话场景。

适合的目标群体

  • 企业自动化运维人员:需要将系统告警、日报等信息以语音形式推送到飞书群的场景
  • 多平台社群运营者:统一管理 Telegram、Discord、飞书等渠道的语音内容分发
  • 开发者与系统集成商:需要快速集成语音消息能力的项目团队
  • 无障碍辅助工具构建者:为视障用户或特定场景提供语音化信息输出

使用风险

性能风险:edge-tts 首次调用需建立网络连接并下载语音模型,冷启动延迟约 2-5 秒;长文本合成需分段处理,单次建议控制在 500 字以内。

依赖项风险:ffmpeg 版本差异可能导致音频参数不兼容,建议使用 4.0+ 版本;edge-tts 需 Python 3.7+ 环境。

服务可用性风险:Microsoft TTS 服务存在速率限制(未明确文档),高频调用可能触发限流;飞书 API 有调用配额限制,需关注企业版/免费版差异。

数据隐私风险:输入文本发送至 Microsoft 服务器,虽官方承诺不存储语音合成内容,但敏感信息(密码、密钥、个人身份信息)应避免通过此渠道转换。

Token 安全风险:tenant_access_token 泄露可能导致飞书应用权限被滥用,建议配置 IP 白名单、使用短期令牌并定期轮换。

Voice Message 内容

references文件夹
scripts文件夹
手动下载zip · 5.7 kB
voices.mdtext/markdown
请选择文件