核心用法
本技能为编排型元技能(meta-skill),通过单一脚本串联部署两个独立组件,构建完整的浏览器语音输入栈:
| 组件 | 角色 | 默认端点 |
|------|------|----------|
| `faster-whisper-local-service` | 本地 STT 后端 | `127.0.0.1:18790` |
| `webchat-voice-proxy` | HTTPS/WSS 代理 + UI 注入 | `8443` |
执行 bash scripts/deploy.sh 即可完成依赖检查、服务启动与端口绑定。支持环境变量覆盖(VOICE_HOST、VOICE_HTTPS_PORT、TRANSCRIBE_PORT),便于局域网或多实例部署。部署后运行 bash scripts/status.sh 验证健康状态。
显著优点
- 零边际成本:完全本地推理,无外部 STT API 调用费用
- 隐私优先:语音数据不出本机,适合敏感场景
- 即开即用:单条命令完成双服务编排,降低配置门槛
- 模块化设计:下层技能可独立复用,不强制绑定部署
潜在局限
1. 硬件依赖:faster-whisper 需 CUDA 或足够性能的 CPU,低配设备实时性受限
2. 证书管理:自签名 HTTPS 证书可能触发浏览器安全警告,需手动信任或替换为域证书
3. 浏览器兼容性:WSS 麦克风权限受浏览器策略限制,部分移动端浏览器支持不完善
4. 故障排查复杂度:跨两个进程的日志分散,需分别检查 18790 与 8443 端口状态
适合人群
- 需要在 OpenClaw WebChat 中快速启用语音输入的开发者
- 对数据隐私有严格要求、拒绝云端 STT 的企业/个人用户
- 已具备
skills/目录结构、熟悉 Docker/本地服务运维的技术人员
常规风险
- 端口冲突:18790 或 8443 被占用会导致启动失败,需提前释放或调整配置
- 模型首次加载延迟:faster-whisper 需下载/加载 Whisper 模型,冷启动可能耗时数十秒
- 代理层单点故障:webchat-voice-proxy 若崩溃,前端语音功能完全中断,但文本聊天不受影响
- 本地资源抢占:大模型推理时 GPU/内存占用高,可能影响主机其他服务