核心用法
Voice Assistant for OpenClaw 是一款专为 Windows 设计的语音交互伴侣应用,通过多组件协作实现完整的语音对话闭环。用户可通过自定义唤醒词(如 "Hey OpenClaw")或全局热键(默认 Ctrl+Shift+K)激活助手,随后自然语音输入经本地 faster-whisper 模型实时转写为文本,通过 WebSocket 发送至 OpenClaw Gateway 获取 AI 响应,最终由 ElevenLabs TTS 引擎合成自然语音输出。
技术链路清晰:麦克风输入 → Porcupine 唤醒检测 → 录音与 VAD 静音检测 → faster-whisper 本地转写 → Gateway 流式响应 → ElevenLabs 语音合成 → 扬声器输出。全程支持多轮对话,每次回复后自动进入 5 秒监听窗口,实现无缝连续交互。
配置高度灵活,通过 .env 文件可调节唤醒灵敏度(0.0-1.0)、静音超时阈值(默认 1.5 秒)、Whisper 模型尺寸(tiny 至 large)、语音角色(免费 Matilda 或付费 Ivy)等参数。支持自定义 .ppn 唤醒词模型,并提供个性化提示音生成工具,让激活音效与思考音效匹配所选人声。
系统托盘集成使其适合长期后台运行,start.bat 支持无窗口启动,可加入 Windows 启动项实现开机自启。
显著优点
1. 隐私优先的本地处理:核心 STT 采用 faster-whisper 本地推理,敏感语音数据不上传云端,仅 TTS 环节调用 ElevenLabs API
2. 极低延迟的流式交互:Gateway WebSocket 流式传输 + ElevenLabs 流式合成,响应感知流畅
3. 多轮对话连续性:自动跟进监听机制免去了重复唤醒的繁琐,对话体验接近原生语音助手
4. 声学反馈闭环:激活音效、思考填充音、麦克风自动抑制(防止回授)共同构建完整的听觉交互体验
5. Windows 原生集成:系统托盘控制、全局热键、无窗口后台运行,符合 Windows 用户习惯
潜在缺点与局限性
1. 平台绑定:仅支持 Windows(win32),macOS/Linux 用户无法使用
2. 多服务依赖:需同时配置 OpenClaw Gateway、ElevenLabs、Picovoice 三项外部服务,入门门槛较高
3. ElevenLabs 成本:免费版有字符额度限制,重度使用需付费订阅
4. Whisper 本地算力消耗:虽支持 int8 量化,但较大模型在低端 CPU 上仍有明显延迟
5. 网络依赖:AI 推理依赖 Gateway,TTS 依赖 ElevenLabs,离线场景不可用
适合人群
- 已部署 OpenClaw 生态的 Windows 深度用户
- 追求隐私与响应速度平衡、愿接受本地+云端混合架构的技术爱好者
- 需要长时间后台语音交互、重视多轮对话连续性的效率型用户
- 希望自定义唤醒词与语音人格的个性化需求者
常规风险
1. API 密钥泄露风险:.env 文件存储多组敏感密钥,需避免误提交至版本控制或共享环境
2. 麦克风权限劫持:应用持续监听麦克风,虽本地处理但存在被恶意利用的理论风险
3. ElevenLabs 账户安全:API 密钥泄露可能导致额度盗刷,建议设置用量告警
4. WebSocket 明文传输:默认 ws:// 无加密,若 Gateway 跨网络部署存在窃听风险
5. 依赖项供应链:Python 虚拟环境与多组件依赖存在潜在供应链攻击面