Voice Assistant

🎙️ 为 OpenClaw 赋予自然语音交互

Windows 本地语音助手,集成 Porcupine 唤醒词、Whisper 离线语音转写与 ElevenLabs 高质量语音合成,支持多轮对话与系统托盘后台运行

收藏
6.4k
安装
1.3k
版本
1.0.4
CLS 安全性认证2026-08-02
点击查看完整报告 >

使用说明

核心用法

Voice Assistant for OpenClaw 是一款专为 Windows 设计的语音交互伴侣应用,通过多组件协作实现完整的语音对话闭环。用户可通过自定义唤醒词(如 "Hey OpenClaw")或全局热键(默认 Ctrl+Shift+K)激活助手,随后自然语音输入经本地 faster-whisper 模型实时转写为文本,通过 WebSocket 发送至 OpenClaw Gateway 获取 AI 响应,最终由 ElevenLabs TTS 引擎合成自然语音输出。

技术链路清晰:麦克风输入 → Porcupine 唤醒检测 → 录音与 VAD 静音检测 → faster-whisper 本地转写 → Gateway 流式响应 → ElevenLabs 语音合成 → 扬声器输出。全程支持多轮对话,每次回复后自动进入 5 秒监听窗口,实现无缝连续交互。

配置高度灵活,通过 .env 文件可调节唤醒灵敏度(0.0-1.0)、静音超时阈值(默认 1.5 秒)、Whisper 模型尺寸(tiny 至 large)、语音角色(免费 Matilda 或付费 Ivy)等参数。支持自定义 .ppn 唤醒词模型,并提供个性化提示音生成工具,让激活音效与思考音效匹配所选人声。

系统托盘集成使其适合长期后台运行,start.bat 支持无窗口启动,可加入 Windows 启动项实现开机自启。

显著优点

1. 隐私优先的本地处理:核心 STT 采用 faster-whisper 本地推理,敏感语音数据不上传云端,仅 TTS 环节调用 ElevenLabs API
2. 极低延迟的流式交互:Gateway WebSocket 流式传输 + ElevenLabs 流式合成,响应感知流畅

3. 多轮对话连续性:自动跟进监听机制免去了重复唤醒的繁琐,对话体验接近原生语音助手

4. 声学反馈闭环:激活音效、思考填充音、麦克风自动抑制(防止回授)共同构建完整的听觉交互体验

5. Windows 原生集成:系统托盘控制、全局热键、无窗口后台运行,符合 Windows 用户习惯

潜在缺点与局限性

1. 平台绑定:仅支持 Windows(win32),macOS/Linux 用户无法使用
2. 多服务依赖:需同时配置 OpenClaw Gateway、ElevenLabs、Picovoice 三项外部服务,入门门槛较高

3. ElevenLabs 成本:免费版有字符额度限制,重度使用需付费订阅

4. Whisper 本地算力消耗:虽支持 int8 量化,但较大模型在低端 CPU 上仍有明显延迟

5. 网络依赖:AI 推理依赖 Gateway,TTS 依赖 ElevenLabs,离线场景不可用

适合人群

  • 已部署 OpenClaw 生态的 Windows 深度用户
  • 追求隐私与响应速度平衡、愿接受本地+云端混合架构的技术爱好者
  • 需要长时间后台语音交互、重视多轮对话连续性的效率型用户
  • 希望自定义唤醒词与语音人格的个性化需求者

常规风险

1. API 密钥泄露风险.env 文件存储多组敏感密钥,需避免误提交至版本控制或共享环境
2. 麦克风权限劫持:应用持续监听麦克风,虽本地处理但存在被恶意利用的理论风险

3. ElevenLabs 账户安全:API 密钥泄露可能导致额度盗刷,建议设置用量告警

4. WebSocket 明文传输:默认 ws:// 无加密,若 Gateway 跨网络部署存在窃听风险

5. 依赖项供应链:Python 虚拟环境与多组件依赖存在潜在供应链攻击面

安全解读

核心用法

voice-assistant 是一款专为 Windows 设计的语音交互伴侣应用,为 OpenClaw 智能体提供完整的语音输入输出能力。用户可通过自定义唤醒词(如 "Hey Claudia")或全局热键激活助手,以自然语言与 AI 进行多轮对话。整个流程高度自动化:唤醒后播放提示音 → 录制语音 → 本地转录为文本 → 通过 WebSocket 发送至 OpenClaw Gateway → 接收流式响应 → ElevenLabs 合成自然语音播放 → 自动进入 5 秒跟进监听模式,实现无缝多轮交流。系统托盘图标支持暂停/恢复/退出操作,可配置开机自启动,适合作为常驻后台的智能语音入口。

显著优点

全流程本地化与低延迟:核心语音识别采用 faster-whisper 本地运行(CPU int8 量化),无需云端 STT 服务,大幅降低响应延迟与网络依赖。唤醒词检测、语音转录、TTS 播放形成完整闭环,用户体验流畅自然。

高度可定制化:支持自定义唤醒词(通过 Picovoice Console 生成 .ppn 文件)、热键绑定、静音阈值、灵敏度调节,以及 ElevenLabs 语音克隆(推荐 Matilda 免费音色或 Ivy 付费音色)。还可生成个性化的激活提示音与思考音效,打造专属语音助手人格。

防反馈智能设计:麦克风自动抑制机制在所有扬声器输出期间静音输入,彻底避免音频回授问题,这是同类本地语音方案中较少见的工程细节。

开源生态整合:紧密对接 OpenClaw Gateway 本地服务,无厂商锁定风险,数据流转透明可控。

潜在缺点与局限性

Windows 平台独占:依赖 winsound、pystray 等 Windows 专属 API,无法跨平台运行于 macOS 或 Linux,限制了用户群体。

外部服务依赖:ElevenLabs TTS 和 Picovoice 唤醒词 SDK 为闭源商业服务,需持续维护 API Key,存在服务条款变更或区域访问限制风险。免费版 ElevenLabs 有月度字符额度限制,高频使用需付费。

硬件与环境配置门槛:需 Python 3.10+ 环境、虚拟环境配置、多服务 API Key 申请(Gateway、ElevenLabs、Picovoice 三处),对非技术用户有一定上手难度。麦克风与扬声器设备兼容性需现场调试。

隐私数据出境:语音文本经 ElevenLabs 境外服务器处理,虽非原始音频数据,但涉及内容敏感场景需评估合规风险。

适合的目标群体

  • OpenClaw 重度用户:希望脱离键盘鼠标、以语音驱动 AI 工作流的效率追求者
  • Windows 开发者/极客:具备 Python 环境配置能力,追求本地化、可定制的语音交互方案
  • 无障碍需求用户:需要语音输入输出替代传统交互方式的特殊群体
  • 智能家居/办公场景:希望构建私有化语音中枢,避免 Alexa/Google 数据上传的技术决策者

常规使用风险

性能与资源占用:faster-whisper 本地模型(base/small 等)持续占用 CPU 资源,老旧设备可能出现转录延迟;ElevenLabs API 调用受网络质量影响,高峰时段可能出现 TTS 排队。

依赖项维护风险:11 个 Python 依赖包需定期审计 CVE 漏洞,特别是 elevenlabs、pvporcupine、faster-whisper 等核心库的版本兼容性。

凭证泄露风险:API Key 以明文存储于 .env 文件,若权限设置不当或被误提交至 Git,可能导致密钥泄露与滥用。

服务中断风险:ElevenLabs 或 Picovoice 服务异常将直接导致 TTS 或唤醒功能失效,建议关注官方状态页并准备降级方案(如热键激活替代唤醒词)。

Voice Assistant 内容

references文件夹
scripts文件夹
src文件夹
手动下载zip · 22.5 kB
architecture.mdtext/markdown
请选择文件