WebChat Voice Full Stack

🎙️ 一键本地语音栈,零成本开启麦克风

一键部署本地语音输入全栈方案,整合 faster-whisper 后端与 HTTPS/WSS 代理,零 API 成本实现浏览器麦克风支持

收藏
4.2k
安装
1.6k
版本
0.1.2
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

本技能为编排型元技能(meta-skill),通过单一脚本串联部署两个独立组件,构建完整的浏览器语音输入栈:

| 组件 | 角色 | 默认端点 |
|------|------|----------|
| `faster-whisper-local-service` | 本地 STT 后端 | `127.0.0.1:18790` |
| `webchat-voice-proxy` | HTTPS/WSS 代理 + UI 注入 | `8443` |

执行 bash scripts/deploy.sh 即可完成依赖检查、服务启动与端口绑定。支持环境变量覆盖(VOICE_HOSTVOICE_HTTPS_PORTTRANSCRIBE_PORT),便于局域网或多实例部署。部署后运行 bash scripts/status.sh 验证健康状态。

显著优点

  • 零边际成本:完全本地推理,无外部 STT API 调用费用
  • 隐私优先:语音数据不出本机,适合敏感场景
  • 即开即用:单条命令完成双服务编排,降低配置门槛
  • 模块化设计:下层技能可独立复用,不强制绑定部署

潜在局限

1. 硬件依赖:faster-whisper 需 CUDA 或足够性能的 CPU,低配设备实时性受限
2. 证书管理:自签名 HTTPS 证书可能触发浏览器安全警告,需手动信任或替换为域证书

3. 浏览器兼容性:WSS 麦克风权限受浏览器策略限制,部分移动端浏览器支持不完善

4. 故障排查复杂度:跨两个进程的日志分散,需分别检查 18790 与 8443 端口状态

适合人群

  • 需要在 OpenClaw WebChat 中快速启用语音输入的开发者
  • 对数据隐私有严格要求、拒绝云端 STT 的企业/个人用户
  • 已具备 skills/ 目录结构、熟悉 Docker/本地服务运维的技术人员

常规风险

  • 端口冲突:18790 或 8443 被占用会导致启动失败,需提前释放或调整配置
  • 模型首次加载延迟:faster-whisper 需下载/加载 Whisper 模型,冷启动可能耗时数十秒
  • 代理层单点故障:webchat-voice-proxy 若崩溃,前端语音功能完全中断,但文本聊天不受影响
  • 本地资源抢占:大模型推理时 GPU/内存占用高,可能影响主机其他服务

WebChat Voice Full Stack 内容

references文件夹
scripts文件夹
手动下载zip · 2.0 kB
architecture.mdtext/markdown
请选择文件