Feishu Speaker

🎙️ 飞书AI语音助手,双向自然沟通

飞书双向语音交互工具,集成Whisper本地转录与Edge-TTS语音合成,实现AI助手的自然语音沟通能力

收藏
4.8k
安装
986
版本
1.1.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

综合评估

feishu-speaker 是一款面向飞书平台的语音消息增强工具,通过整合 OpenAI Whisper(本地语音识别)与 Edge-TTS(微软语音合成),构建完整的双向语音交互闭环。

核心用法

该技能提供三类主要功能:

  • 接收语音转文字feishu-speaker listen voice.ogg 调用本地Whisper模型,支持 tiny/base/small 多规格模型,完全离线运行
  • 文字转语音发送feishu-speaker say "内容" 使用Edge-TTS生成高质量中文语音,提供4种官方推荐音色(男女各2种),语速可调(0.5x-2.0x)
  • 智能回复模式feishu-speaker reply 根据对方消息类型自动匹配回复形式(语音→语音、文字→文字),支持强制覆盖

v1.1.0新增的 reply-voice 脚本进一步封装完整流程:语音接收→转录→TTS生成→发送,适合AI助手场景。

显著优点

1. 完全本地化的隐私保护:Whisper语音识别在本地执行,敏感语音数据不上传云端
2. 零成本语音合成:Edge-TTS基于微软Azure语音服务,免费且质量接近商业级TTS

3. 飞书生态深度集成:原生支持飞书语音格式(opus/ogg),自动格式转换,开箱即用

4. 多场景音色适配:内置商务稳重(YunjianNeural)、日常活泼(YunxiNeural)等场景化音色

局限性与风险

  • 依赖链复杂:需同时安装Python生态(whisper)、Node生态(edge-tts)、系统工具(ffmpeg),环境配置门槛较高
  • 飞书API绑定:功能完全依赖飞书开放平台,若API策略变更或凭证失效将中断服务
  • 模型体积问题:Whisper small模型约1GB,对边缘设备存储和内存有一定要求
  • TTS服务稳定性:Edge-TTS为微软非官方开源封装,存在服务变更或限速风险

适合人群

  • 搭建飞书AI助手/机器人的开发者
  • 需要语音交互能力的自动化工作流用户
  • 重视语音数据隐私、拒绝云端语音识别的敏感场景

风险提示

凭证管理需关注 ~/.openclaw/.credentials/feishu-app-secret.txt 的权限安全;建议生产环境配合飞书IP白名单使用。

Feishu Speaker 内容

config文件夹
scripts文件夹
手动下载zip · 6.7 kB
voice-config.jsonapplication/json
请选择文件