TinkerClaw Jarvis Voice

🎙️ 离线金属质感·零延迟英音

内容创作榜 #28

离线JARVIS风格语音合成,采用sherpa-onnx本地引擎+ffmpeg金属音效处理,零延迟零联网,为AI赋予钢铁侠管家般的高级英音质感。

收藏
13.9k
安装
5.2k
版本
2.1.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Jarvis Voice是一款完全离线的AI语音合成系统,通过sherpa-onnx本地TTS引擎(Alan英式男声)结合ffmpeg多链路音效处理,复刻钢铁侠电影中JARVIS的标志性金属质感声音。采用"混合输出"模式:每次语音响应需同时包含可见文本**Jarvis:** *内容*)和后台音频执行exec(command='jarvis "文本"', background=true)),前者通过OpenClaw webchat的CSS自动渲染为紫色斜体,后者触发本地音频播放。

技术架构

  • 语音引擎:sherpa-onnx离线TTS,基于VITS架构的en_GB-alan-medium模型
  • 语速处理:2倍速播放(--vits-length-scale=0.5)营造AI的紧凑节奏感
  • 音效链:ffmpeg串联处理——升调5%( tighten 感)、镶边器(金属光泽)、15ms回声(机械共鸣)、200Hz高通+6dB高音增强(HUD般清晰)
  • 输出:ALSA直接播放,自动清理临时文件

显著优点

1. 零延迟零依赖:完全本地运行,无需云端API,响应速度仅受限于硬件算力
2. 电影级音质:非简单变调,而是通过专业音频处理链路实现"金属AI"声学特征

3. 双通道确认:视觉+听觉双重反馈,紫色斜体文本即时呈现,音频后台异步播放

4. 跨平台适配:webchat自动渲染紫色样式,WhatsApp/Telegram等渠道回退为标准加粗斜体

潜在局限

  • 语言锁定:Alan模型仅支持英语,非内容需翻译或摘要后播报
  • 字符限制:单次≤1500字符,长文本需分段处理
  • 环境依赖:需完整sherpa-onnx运行时+ffmpeg+ALSA音频系统,首次部署较重
  • 单响应单语音:禁止连续调用,需合并内容后一次性输出

适合人群

  • 追求沉浸式AI交互体验的科技爱好者/极客用户
  • 需要离线隐私保护场景的语音交互需求(无数据上传)
  • Iron Man/JARVIS IP粉丝,追求电影原声音质还原
  • 智能家居/机器人项目的本地语音反馈模块

常规风险

  • 系统兼容性:Linux/macOS需ALSA配置,Windows需额外适配层
  • 模型存储:Alan模型约100MB级,需预留磁盘空间
  • 音频冲突aplay直接占用默认声卡,可能与现有音频服务冲突
  • 误用风险:需严格区分内置tts工具(云端Edge TTS)与jarvis命令

TinkerClaw Jarvis Voice 内容

手动下载zip · 2.6 kB
SKILL.mdtext/markdown
请选择文件