综合评估
feishu-speaker 是一款面向飞书平台的语音消息增强工具,通过整合 OpenAI Whisper(本地语音识别)与 Edge-TTS(微软语音合成),构建完整的双向语音交互闭环。
核心用法
该技能提供三类主要功能:
- 接收语音转文字:
feishu-speaker listen voice.ogg调用本地Whisper模型,支持 tiny/base/small 多规格模型,完全离线运行 - 文字转语音发送:
feishu-speaker say "内容"使用Edge-TTS生成高质量中文语音,提供4种官方推荐音色(男女各2种),语速可调(0.5x-2.0x) - 智能回复模式:
feishu-speaker reply根据对方消息类型自动匹配回复形式(语音→语音、文字→文字),支持强制覆盖
v1.1.0新增的 reply-voice 脚本进一步封装完整流程:语音接收→转录→TTS生成→发送,适合AI助手场景。
显著优点
1. 完全本地化的隐私保护:Whisper语音识别在本地执行,敏感语音数据不上传云端
2. 零成本语音合成:Edge-TTS基于微软Azure语音服务,免费且质量接近商业级TTS
3. 飞书生态深度集成:原生支持飞书语音格式(opus/ogg),自动格式转换,开箱即用
4. 多场景音色适配:内置商务稳重(YunjianNeural)、日常活泼(YunxiNeural)等场景化音色
局限性与风险
- 依赖链复杂:需同时安装Python生态(whisper)、Node生态(edge-tts)、系统工具(ffmpeg),环境配置门槛较高
- 飞书API绑定:功能完全依赖飞书开放平台,若API策略变更或凭证失效将中断服务
- 模型体积问题:Whisper small模型约1GB,对边缘设备存储和内存有一定要求
- TTS服务稳定性:Edge-TTS为微软非官方开源封装,存在服务变更或限速风险
适合人群
- 搭建飞书AI助手/机器人的开发者
- 需要语音交互能力的自动化工作流用户
- 重视语音数据隐私、拒绝云端语音识别的敏感场景
风险提示
凭证管理需关注 ~/.openclaw/.credentials/feishu-app-secret.txt 的权限安全;建议生产环境配合飞书IP白名单使用。