核心用法
Voice Chat Skill 是一套自包含的开源语音交互方案,通过在本地端口嵌入 Hotbutter relay 服务器与 PWA(渐进式 Web 应用),实现"零部署"的浏览器端语音对话。用户执行 voice-bridge start 后,终端输出 6 位配对码与可点击 URL,浏览器打开即完成自动配对,全程无需额外账号或云服务。
技术路径:浏览器端 Speech-to-Text 捕获语音 → WebSocket 传输至本地 relay → 技能作为 agent 接入 → 响应经原路返回 → 浏览器 Text-to-Speech 播报。
显著优点
- 完全本地化:relay 与 PWA 均运行于本地,数据不出设备,隐私可控。
- 极低门槛:单条命令启动,浏览器即客户端,无需安装 App。
- 开源可审计:代码透明,支持自定义端口(
--port)与 agent 名称(--agent-name)。 - 架构解耦:WebSocket 中继设计便于二次开发,可对接任意支持该协议的 agent。
潜在局限
- 浏览器依赖:STT/TTS 质量受浏览器实现差异影响(Chrome 优于 Safari)。
- 网络局限:虽为本地服务,但仍需同一网络环境或端口暴露才能跨设备访问。
- 功能边界:当前为轻量 relay,无多轮对话状态管理、无用户认证、无录音持久化。
- 维护状态:依赖个人开发者(@DnuLkjkjh),长期支持存不确定性。
适合人群
- 开发者/极客希望快速搭建私有化语音 AI Demo。
- 对云端 STT/TTS 有合规顾虑的企业内网场景。
- 希望低代码集成语音能力的开源 agent 项目。
常规风险
- 本地服务暴露:若绑定公网 IP 或端口转发,可能面临未授权访问风险。
- 浏览器权限:需授予麦克风权限,敏感环境需评估。
- 无加密声明:文档未提及 WSS/TLS,生产环境建议自行配置 HTTPS/WSS。