WebChat Voice Proxy

🎙️ WebChat 本地化语音输入,零 API 成本

为 OpenClaw WebChat 添加本地化语音输入能力,通过浏览器录音+faster-whisper 本地转录,零 API 成本,含 HTTPS 代理与自动更新安全机制。

收藏
4.5k
安装
1.5k
版本
0.2.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能

webchat-voice-proxy 是一套完整的语音输入增强方案,专为 OpenClaw WebChat 的 Control UI 设计。它在浏览器端注入麦克风按钮 UI,利用 MediaRecorder API 录制音频,通过本地 HTTPS/WSS 代理转发至 faster-whisper 服务完成转录,最终将识别文本自动填入对话输入框。整个流程完全本地化,无需调用第三方语音识别 API,从根本上消除云服务依赖与持续费用。

显著优点

零成本本地化架构:依赖开源 faster-whisper 模型(支持 CUDA/CPU),一次性部署后永久免费使用,隐私敏感场景下音频数据不出本机。

系统级持久化:通过 systemd 用户服务 (openclaw-voice-https.service) 与 gateway hook 机制,确保系统重启、OpenClaw 自动更新后语音功能自动恢复,无需手动干预。

工程完整性:提供自签名 TLS 证书自动管理、WebSocket 透传、SPA 路由回退、CORS 白名单自动配置等生产级细节,非简单的脚本拼凑。

潜在局限与风险

强依赖前置条件:必须预先部署并运行 faster-whisper-local-service(默认端口 18790),且需约 1-3GB 模型文件与相应 GPU/CPU 资源,低配设备可能延迟明显。

自签名证书信任成本:首次使用需在浏览器手动信任自签 HTTPS 证书,团队部署时需额外分发根证书或替换为机构证书。

浏览器兼容性MediaRecorder 编码格式(通常 WebM/Opus)需与 faster-whisper 输入格式匹配,特定浏览器或版本可能存在转码失败风险。

系统修改范围较广:涉及 npm 全局目录文件注入、systemd 服务、hook 目录、用户配置 JSON 修改,虽提供完整卸载脚本,但仍有误操作或残留状态风险。

适合人群

  • 追求完全本地化、隐私优先的 OpenClaw 高级用户
  • 有 Linux 运维能力、能独立排查 systemd/网络问题的开发者
  • 已部署或愿意部署 faster-whisper 服务的技术团队

常规风险提示

  • 卸载时默认保留工作目录与 TLS 证书,彻底清理需手动执行 rm -rf
  • 转录服务端未运行时,语音按钮将静默失败或超时,需前置健康检查
  • 多设备场景下需注意 gateway.controlUi.allowedOrigins 的 origin 白名单管理,避免跨域拦截

WebChat Voice Proxy 内容

assets文件夹
hooks文件夹
references文件夹
scripts文件夹
手动下载zip · 12.9 kB
https-server.pytext/plain
请选择文件