核心用法
Deepgram Discord Voice 是一款面向 Discord 语音频道的实时 AI 对话插件,专为 Clawdbot/OpenClaw 平台设计。其核心功能是将 Discord 语音通道中的音频流转为文字,经 AI 处理后再以语音形式实时回复,形成完整的语音-语音交互闭环。
技术架构:采用 Deepgram Nova-2 模型进行流式语音识别(WebSocket 连接),识别结果送入 Agent 处理后,通过 Deepgram Aura TTS API(/v1/speak)以 Ogg/Opus 流式格式返回,直接播放至 Discord 频道,端到端延迟极低。
关键特性:
- 权限管控:通过
primaryUser锁定主控用户,支持语音指令动态授权他人(如 "openclaw allow 用户名") - 唤醒词机制:默认 "openclaw" 前缀触发控制指令
- 语音打断(Barge-in):允许用户中断 AI 播报
- 多语言支持:可配置 BCP-47 语言标签(如 en-US、es-EC)
- VAD 灵敏度调节:低/中/高三档语音活动检测
显著优点:
1. 低延迟体验:流式 STT + 流式 TTS 双端优化,接近实时对话
2. 部署便捷:npm 安装或 ClawHub 一键集成,配置即开即用
3. 权限安全:默认仅监听指定用户,避免误触发或恶意干扰
4. 音质优秀:Deepgram Aura 系列语音自然度高,支持多种音色选择
潜在局限与风险:
- 第三方依赖:完全依赖 Deepgram API 稳定性与定价策略,存在服务中断或成本波动风险
- Discord 生态限制:需维护 bot 连接状态,受 Discord 网关速率限制
- 隐私考量:语音数据需传输至 Deepgram 云端处理,敏感场景需评估合规性
- 网络依赖:WebSocket 连接对网络质量敏感,弱网环境可能出现断连
适合人群:Discord 社群运营者、游戏团队指挥、远程协作小组、需要免手操作 AI 助手的开发者与技术爱好者。
常规风险:API 密钥泄露风险(需妥善保管 DISCORD_TOKEN 与 DEEPGRAM_API_KEY)、语音指令被误识别导致的非预期操作、多用户场景下的权限管理复杂度。