核心用法
飞书语音消息发送技能(feishu-voice)是一套自动化语音消息工作流,打通「文本→语音→飞书消息」全链路。用户仅需调用 send_voice.sh 脚本并传入文本内容,系统即可自动完成 TTS 生成、格式转换、语速调整、时长读取、文件上传及消息发送。
典型调用示例:
bash scripts/send_voice.sh "会议提醒:下午三点项目评审" 2 1.2 # 参数:文本内容 | voice_id | 语速(0.5-2.0x)
技术实现路径:
1. 调用 coze-tts 生成 MP3 格式音频
2. ffmpeg atempo 滤镜调整语速(可选)
3. ffmpeg 转码为 opus 格式(飞书强制要求:libopus/24k/24000Hz/单声道)
4. ffprobe 提取精确时长(毫秒级整数)
5. 上传至飞书文件服务(必须携带 duration 参数,否则显示为0秒)
6. 发送 msg_type=audio 消息
显著优点
- 端到端自动化:单命令完成复杂音视频处理链路,无需人工干预格式转换
- 企业级集成:直接对接飞书开放平台,消息样式原生支持,在聊天窗口可直接播放
- 灵活可控:支持 Coze 多音色切换与 0.5-2.0x 动态语速,适应通知、客服、播报等多场景
- 技术栈成熟:基于 ffmpeg/ffprobe 工业标准工具,音频处理稳定可靠
潜在缺点与局限性
- 外部依赖密集:需同时配置飞书应用凭证(App ID/Secret)与 Coze API Key,以及本地安装 ffmpeg、ffprobe、jq
- 链式故障风险:任一环节(TTS 服务、飞书 API、网络、本地工具)异常均会导致整体失败
- 无持久化日志:文档未提及结构化日志或重试机制,生产环境排障需手动追踪
- 速率限制未知:未披露 Coze TTS 与飞书 API 的 QPS/日调用上限,高频场景可能触发限流
- 单声道限制:强制单声道 opus,立体声内容会被降维处理
适合人群
- 企业自动化运维:需将系统告警、定时任务通知转为语音推送至飞书群
- 客服/运营团队:批量发送个性化语音触达用户,替代纯文本降低阅读成本
- 开发者/DevOps:已具备飞书应用开发经验,寻求快速集成 TTS 能力的团队
常规风险
- 凭证泄露:App Secret 与 Coze API Key 以环境变量方式管理,需确保
.bashrc、CI/CD 变量等存储位置安全,避免提交至代码仓库 - API 权限越界:飞书应用需申请
im:message与im:message:send_as_bot权限,过度授权可能导致消息发送范围失控 - 临时文件残留:虽文档声称自动清理,但异常中断时
/tmp可能堆积音频文件,建议定期检查 - 时长参数缺失:若 ffprobe 解析失败导致
duration未传入,飞书端显示 0 秒语音,用户体验受损但无报错提示 - 第三方服务稳定性:Coze TTS 与飞书 API 均为外部依赖,服务变更或下线将直接影响功能可用性