核心功能
videochat-withme 是一款将 OpenClaw 智能体从纯文字升级为多模态交互系统的创新工具。它构建了完整的音视频通话管道:通过 Groq Whisper 实现毫秒级语音识别,利用 edge-tts 调用微软云服务合成自然语音,同时让智能体实时"看见"用户的摄像头画面,实现真正的视听融合对话。
显著优势
极致的低延迟体验:Groq Whisper 以业界领先的推理速度提供实时转录,配合本地网关架构,端到端延迟控制在可感知的人机对话水平。相比传统 WebRTC 方案,这种"云 STT + 本地 LLM + 云 TTS"的分层设计在质量与速度间取得精妙平衡。
深度个性化交互:智能体不仅"看见"用户表情和手势,还能通过记忆系统延续对话上下文,配合自定义人格设定,营造真正"认识你"的通话体验。支持中英文等多语言唤醒词("视频一下"、"打电话给我"),本土化程度极高。
灵活的部署架构:内置 Tailscale 自动检测,同一命令可根据用户位置智能选择内网直连或安全隧道穿透,兼顾便捷性与安全性。
局限与风险
隐私边界模糊:摄像头画面若配置云 LLM(如 GPT-4V、Claude 3)则必然上传至第三方服务器,文档虽提示但未强制阻断;音频流经 Groq、TTS 流经微软,形成跨云数据分发。用户需明确知晓"实时影像可能离开本地机器"。
平台锁定较重:launchd 服务仅支持 macOS,Linux/Windows 用户无法使用;SSL 证书自签名导致首次访问需手动放行,移动端体验打折。
供应链依赖风险:核心功能捆绑 Groq API(免费额度有限)、Microsoft TTS(国内可用性不稳定)及 Tailscale(可选但推荐),任一服务波动将影响体验。
适合人群
追求沉浸式 AI 交互的极客用户、需要远程"面对面"指导的场景(如编程教学、设备调试)、以及希望探索多模态 Agent 可能性的开发者。不适合对数据主权高度敏感、或无法容忍任何云端依赖的隐私极端主义者。
安全建议
- 优先配置本地 LLM(如 Ollama)处理视觉输入,确保影像不出机
- 定期审计
~/.openclaw/secrets/权限,避免 API 密钥泄露 - 通过防火墙限制 8766 端口仅 Tailscale 网段可访问,防止公网暴露