核心用法
Jarvis Voice是一款完全离线的AI语音合成系统,通过sherpa-onnx本地TTS引擎(Alan英式男声)结合ffmpeg多链路音效处理,复刻钢铁侠电影中JARVIS的标志性金属质感声音。采用"混合输出"模式:每次语音响应需同时包含可见文本(**Jarvis:** *内容*)和后台音频执行(exec(command='jarvis "文本"', background=true)),前者通过OpenClaw webchat的CSS自动渲染为紫色斜体,后者触发本地音频播放。
技术架构
- 语音引擎:sherpa-onnx离线TTS,基于VITS架构的en_GB-alan-medium模型
- 语速处理:2倍速播放(
--vits-length-scale=0.5)营造AI的紧凑节奏感 - 音效链:ffmpeg串联处理——升调5%( tighten 感)、镶边器(金属光泽)、15ms回声(机械共鸣)、200Hz高通+6dB高音增强(HUD般清晰)
- 输出:ALSA直接播放,自动清理临时文件
显著优点
1. 零延迟零依赖:完全本地运行,无需云端API,响应速度仅受限于硬件算力
2. 电影级音质:非简单变调,而是通过专业音频处理链路实现"金属AI"声学特征
3. 双通道确认:视觉+听觉双重反馈,紫色斜体文本即时呈现,音频后台异步播放
4. 跨平台适配:webchat自动渲染紫色样式,WhatsApp/Telegram等渠道回退为标准加粗斜体
潜在局限
- 语言锁定:Alan模型仅支持英语,非内容需翻译或摘要后播报
- 字符限制:单次≤1500字符,长文本需分段处理
- 环境依赖:需完整sherpa-onnx运行时+ffmpeg+ALSA音频系统,首次部署较重
- 单响应单语音:禁止连续调用,需合并内容后一次性输出
适合人群
- 追求沉浸式AI交互体验的科技爱好者/极客用户
- 需要离线隐私保护场景的语音交互需求(无数据上传)
- Iron Man/JARVIS IP粉丝,追求电影原声音质还原
- 智能家居/机器人项目的本地语音反馈模块
常规风险
- 系统兼容性:Linux/macOS需ALSA配置,Windows需额外适配层
- 模型存储:Alan模型约100MB级,需预留磁盘空间
- 音频冲突:
aplay直接占用默认声卡,可能与现有音频服务冲突 - 误用风险:需严格区分内置
tts工具(云端Edge TTS)与jarvis命令