Discord Voice Using Deepgram

🎙️ Discord 实时语音 AI 助手

Discord 语音频道 AI 助手,集成 Deepgram 流式语音识别与合成,支持低延迟双向语音交互,可设置唤醒词与权限管控。

收藏
10.5k
安装
2.1k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Deepgram Discord Voice 是一款面向 Discord 语音频道的实时 AI 对话插件,专为 Clawdbot/OpenClaw 平台设计。其核心功能是将 Discord 语音通道中的音频流转为文字,经 AI 处理后再以语音形式实时回复,形成完整的语音-语音交互闭环。

技术架构:采用 Deepgram Nova-2 模型进行流式语音识别(WebSocket 连接),识别结果送入 Agent 处理后,通过 Deepgram Aura TTS API(/v1/speak)以 Ogg/Opus 流式格式返回,直接播放至 Discord 频道,端到端延迟极低。

关键特性

  • 权限管控:通过 primaryUser 锁定主控用户,支持语音指令动态授权他人(如 "openclaw allow 用户名")
  • 唤醒词机制:默认 "openclaw" 前缀触发控制指令
  • 语音打断(Barge-in):允许用户中断 AI 播报
  • 多语言支持:可配置 BCP-47 语言标签(如 en-US、es-EC)
  • VAD 灵敏度调节:低/中/高三档语音活动检测

显著优点
1. 低延迟体验:流式 STT + 流式 TTS 双端优化,接近实时对话

2. 部署便捷:npm 安装或 ClawHub 一键集成,配置即开即用

3. 权限安全:默认仅监听指定用户,避免误触发或恶意干扰

4. 音质优秀:Deepgram Aura 系列语音自然度高,支持多种音色选择

潜在局限与风险

  • 第三方依赖:完全依赖 Deepgram API 稳定性与定价策略,存在服务中断或成本波动风险
  • Discord 生态限制:需维护 bot 连接状态,受 Discord 网关速率限制
  • 隐私考量:语音数据需传输至 Deepgram 云端处理,敏感场景需评估合规性
  • 网络依赖:WebSocket 连接对网络质量敏感,弱网环境可能出现断连

适合人群:Discord 社群运营者、游戏团队指挥、远程协作小组、需要免手操作 AI 助手的开发者与技术爱好者。

常规风险:API 密钥泄露风险(需妥善保管 DISCORD_TOKEN 与 DEEPGRAM_API_KEY)、语音指令被误识别导致的非预期操作、多用户场景下的权限管理复杂度。

Discord Voice Using Deepgram 内容

src文件夹
手动下载zip · 28.9 kB
config.tstext/plain
请选择文件