TinkerClaw Jarvis Voice

🗣️ 离线AI语音·英伦腔调

为AI赋予JARVIS风格离线语音合成,集成Sherpa-ONNX英国男声与FFmpeg金属音效处理,支持实时语音输出与Webchat紫色UI渲染。

收藏
24.7k
安装
5.2k
版本
2.3.0
CLS 安全性认证2026-07-13
点击查看完整报告 >

使用说明

核心用法

jarvis-voice 是一套面向OpenClaw代理的离线语音合成技能,通过调用本地Sherpa-ONNX TTS引擎(Alan英国男声模型)生成语音,并经由FFmpeg音频处理链添加标志性JARVIS音效:5%音高提升、金属质感镶边效果(Flanger)、15毫秒机器人回声、200Hz高通滤波与+6dB高频增强。开发者需在响应中同步输出可见转录文本**Jarvis:** *spoken text*格式)与后台音频执行命令exec(command='jarvis "text"', background=true)),实现"混合输出"体验。Webchat界面会自动识别该格式并渲染为紫色斜体样式(#9b59b6)。

显著优点

  • 完全离线:依赖本地Sherpa-ONNX运行库,零网络延迟、零API费用、零云端依赖
  • 独特人格化音色:Alan英式男声经2倍速压缩(--vits-length-scale=0.5)与多层音效处理,呈现冷静、略带讽刺的AI人格
  • 深度UI集成:OpenClaw Webchat原生支持紫色JARVIS样式渲染,无需额外CSS
  • 多场景适配:除实时扬声器输出(aplay)外,支持导出OGG/Opus格式供WhatsApp等第三方平台使用

潜在局限

  • 英语独占:Alan模型无法处理非英语内容,需前置翻译或摘要
  • Linux平台限制:依赖ALSA(aplay)与系统级ffmpeg,macOS/Windows需额外适配
  • 字符上限:单次合成长度限制1500字符,长文本需分段策略
  • 硬件依赖:需预下载~100MB语音模型,对边缘设备存储有要求

适合人群

  • 构建钢铁侠/JARVIS风格AI助手的开发者
  • 追求离线隐私、拒绝云端TTS的自主托管用户
  • 需要为现有OpenClaw代理增加语音交互层的技术爱好者
  • 研究多模态AI人格化(voice + humor + memory架构)的前沿探索者

常规风险

  • 命令执行边界jarvis脚本调用本地shell,虽参数固定(硬编码模型路径与FFmpeg链),仍需审计脚本内容防范路径遍历
  • 临时文件管理/tmp/jarvis_raw.wav/tmp/jarvis_final.wav需确保清理逻辑健壮,避免磁盘堆积
  • 音频设备竞争:直接操作plughw:0,0可能与其他音频应用冲突,多用户场景需配置ALSA权限
  • 依赖链脆弱性:Sherpa-ONNX库版本、FFmpeg编译选项(需支持libopus)、ALSA配置任一环节缺失即导致功能失效

安全解读

核心功能

jarvis-voice 是一套为OpenClaw代理设计的离线语音合成技能,将AI交互从纯文本提升至电影《钢铁侠》中JARVIS级别的语音体验。该技能基于sherpa-onnx开源TTS引擎,采用Piper项目的英式Alan语音模型(en_GB-alan-medium),通过ffmpeg音频处理管道添加标志性的"金属质感"音效——包括5%音高提升、镶边效果(flanger)、15ms回声、200Hz高通滤波和+6dB高频增强,最终输出具有未来科技感的AI助手语音。

显著优点

1. 完全离线运行:所有语音合成和音效处理均在本地完成,无需联网,无API密钥,无数据外泄风险,符合GDPR数据最小化原则
2. 高度还原的JARVIS风格:从音色选择到音效处理链,均围绕"冷静、略带讽刺的英式AI管家"这一核心人设设计

3. 混合输出模式:同时提供可视文本转录(紫色斜体Jarvis:前缀)和音频播放,适配WebChat、WhatsApp、Telegram等多平台

4. 低延迟响应:2倍速语音合成(vits-length-scale=0.5)配合后台异步播放,不阻塞主响应流

5. 开源可信依赖:核心引擎来自k2-fsa社区的sherpa-onnx项目,语音模型由Piper项目提供,均为活跃维护的开源项目

潜在局限

1. 英语单一语言:Alan模型仅支持英语,非英语内容需翻译或摘要后语音输出
2. Linux平台限制:当前仅支持Linux系统,依赖ALSA音频子系统(aplay)

3. 字符长度限制:单次语音输出建议≤1500字符,长文本需分段处理

4. 环境配置复杂:需预先部署sherpa-onnx运行时(~50MB模型)、系统ffmpeg/aplay、以及自定义jarvis脚本到PATH

5. 无内置语音激活:需显式调用jarvis命令触发语音,无自动语音检测机制

适合人群

  • 追求沉浸式AI交互体验的技术爱好者和开发者
  • 需要离线语音能力的隐私敏感场景(如本地知识库、企业内网部署)
  • 钢铁侠/JARVIS文化认同用户,希望复刻电影中的交互仪式感
  • 已部署OpenClaw生态、寻求语音扩展能力的现有用户

常规风险

1. Shell执行权限:技能需shell.execute权限运行本地jarvis脚本,虽命令参数固定,但仍属潜在攻击面
2. 模型供应链:需从GitHub Releases下载~50MB语音模型文件,建议校验文件完整性

3. 脚本审计依赖:jarvis脚本由用户自行部署至~/.local/bin/,安装前需人工审查确认无恶意代码

4. 音频设备独占:aplay直接访问硬件音频设备,可能与其他音频应用冲突

TinkerClaw Jarvis Voice 内容

手动下载zip · 3.6 kB
SKILL.mdtext/markdown
请选择文件