核心功能
feishu-speaker 是一款专为飞书平台设计的双向语音消息工具,打通语音转文字(ASR)与文字转语音(TTS)的完整链路,让AI助手能够以自然语音方式与用户交互。
显著优点
1. 双向语音能力:区别于单一方向的语音工具,同时支持接收语音转文字(OpenAI Whisper本地处理)和发送文字转语音(Edge-TTS多音色合成),实现真正的语音对话闭环。
2. 本地化隐私保护:Whisper转录完全本地运行,无需联网上传音频,敏感语音内容不上云端,适合企业私密场景。
3. 丰富的音色选择:提供4种中文音色(男/女/年轻/成熟),支持语速调节(0.5x-2.0x),可匹配正式商务、日常交流、客服等不同场景的人格化表达。
4. 智能回复模式:根据接收消息类型自动选择回复方式(语音→语音,文字→文字),减少人工配置成本。
潜在局限与风险
- 依赖复杂度:需同时安装Python(Whisper)、Node.js(Edge-TTS)、FFmpeg三套环境,部署门槛较高
- 飞书生态绑定:深度耦合飞书API,无法迁移至其他IM平台
- 本地算力要求:Whisper模型运行需要一定GPU/CPU资源,large模型在普通设备上延迟明显
- Edge-TTS网络依赖:虽号称"Edge",但实际仍需微软服务网络,国内偶有连接不稳定
适合人群
- 需要为飞书机器人增加"人格化"语音交互的开发者
- 企业内部智能助手/数字员工项目的运维团队
- 对语音隐私有要求、偏好本地转录方案的用户
常规风险
配置文件中需硬编码app_secret和receiver_id,存在凭证泄露风险;建议配合.credentials文件权限管理(600),避免提交至版本控制。