TinkerClaw Jarvis Voice

🗣️ 离线AI语音·英式管家音色·幽默人格

为AI代理添加离线语音合成能力,采用sherpa-onnx本地TTS引擎,配合ffmpeg音效处理实现钢铁侠JARVIS风格的英式口音与金属质感音色,内置幽默人格模板。

收藏
16.1k
安装
5.2k
版本
3.1.1
CLS 安全性认证2026-07-11
点击查看完整报告 >

使用说明

核心功能

jarvis-voice 是一款为OpenClaw代理打造的离线语音合成技能,通过整合sherpa-onnx本地TTS引擎(Piper en_GB Alan语音模型)与ffmpeg音频处理链,赋予AI代理具有辨识度的"JARVIS式"声音特征。

技术实现

  • 语音合成:基于sherpa-onnx的VITS模型,采用英国男性Alan音色,语速2倍加速(--vits-length-scale=0.5),纯离线运行
  • 音效处理:ffmpeg多阶段处理链——音高提升5%(紧缩感)、镶边效果(金属光泽)、15ms回声(机械共鸣)、高通200Hz+高音增强6dB(HUD清晰度)
  • 输出方式:通过aplay直接播放至默认音频设备,或使用jarvisshell命令在后台异步执行

使用模式

采用"混合输出"设计:先执行exec(command='jarvis "文本"', background=true)触发语音,再以**Jarvis:** *文本*格式输出可见转录。Webchat界面自动渲染为紫色斜体样式,非网页端保持粗体斜体兼容。

幽默人格集成

该技能并非单纯语音工具,而是与ai-humor-ultimate配套的认知架构组件。内置四种研究验证的喜剧模式:干冷机智(dry wit)、AI自我认知(self-aware AI)、外星观察者视角(alien observer)、习语字面拆解(literal idiom play),频率设为最大值。

显著优点

  • 完全离线:无需网络连接,无云端API依赖,隐私数据零外传
  • 确定性执行jarvis脚本参数固定,无动态命令注入风险
  • 低延迟:本地TTS+后台播放,语音与文本几乎同步感知
  • 高度可定制:ffmpeg效果链、语音模型、语速参数均可调整
  • 生态整合:与OpenClaw工作区注入机制配合,通过VOICE.md/SESSION.md/HUMOR.md模板实现会话级自动激活

局限性与风险

  • 英语唯一:Alan模型不支持多语言,非英语内容需先翻译
  • Linux限定:依赖ALSA (aplay),macOS/Windows需额外适配
  • 环境依赖重:需预装sherpa-onnx运行时、ffmpeg、配置SHERPA_ONNX_TTS_DIR环境变量
  • 硬件耦合:默认使用plughw:0,0设备,多声卡环境需手动调整
  • 字符限制:单次语音≤1500字符,长文本需分段处理
  • 无权限隔离:脚本以用户级权限运行,虽无提权设计但亦无沙箱保护

适合人群

  • 构建本地化AI助手、追求《钢铁侠》JARVIS沉浸体验的技术爱好者
  • 对语音隐私敏感、拒绝云端TTS服务的用户
  • 已部署OpenClaw生态、希望扩展多模态交互的开发者
  • 具备Linux系统管理基础、能独立排查音频子系统问题的用户

安全评估

该技能的安全设计偏向"确定性透明":命令固定、开源可审计、无网络行为。主要风险集中于供应链(从GitHub Releases下载模型包)和本地环境配置。建议用户在首次使用前审阅jarvis脚本内容,确认无恶意代码植入。

安全解读

核心用法

jarvis-voice 是一套人格化语音技能,通过本地离线TTS(sherpa-onnx)和ffmpeg音频处理,为AI代理赋予类似《钢铁侠》中JARVIS的英式男声与冷幽默人格。使用时需通过 exec(command='jarvis "文本"', background=true) 触发语音播放,同时输出 **Jarvis:** *文本* 格式的紫色斜体转录。

显著优点

1. 完全离线隐私安全:基于sherpa-onnx的Piper TTS引擎和本地ffmpeg处理,零云端依赖,无数据外泄风险
2. 人格化体验深度:不仅提供语音,更整合了四种研究-backed幽默模式(冷幽默、AI自反、外星观察者、习语字面解读),参考LIMBIC计算幽默论文

3. 专业音频质感:ffmpeg效果链包含音高提升5%、镶边器、15ms回声、高通滤波+6dB高音增强,呈现标志性的"HUD界面"金属感

4. 混合输出架构:语音优先于文本渲染,配合自动紫色CSS样式,实现影院级沉浸体验

5. 模块化生态:可与ai-humor-ultimate等技能组合,构建完整的认知架构

潜在缺点与局限性

1. 平台受限:仅支持Linux(依赖ALSA的aplay),macOS/Windows用户无法直接使用
2. 英语唯一:Alan语音模型仅限英式英语,其他语言需翻译摘要

3. T3来源风险:社区个人项目(globalcaos)维护,无企业级SLA保障

4. 配置复杂度:需手动部署jarvis脚本、下载模型、配置环境变量,非开箱即用

5. 字符限制:单次语音≤1500字符,长内容需分段

6. 无自动触发:必须显式调用exec,服务器端hook已被禁用

适合人群

  • Iron Man/JARVIS影迷寻求角色扮演沉浸感
  • 本地隐私优先用户(医疗、法律、金融场景)
  • 开源AI架构研究者(附带学术论文和12技能认知架构)
  • Linux技术用户具备shell脚本调试能力

常规风险

| 风险项 | 等级 | 说明 |
|--------|------|------|
| exec调用本地脚本 | 低 | 参数固定,仅传递文本至TTS,已在文档明确披露 |
| 外部模型下载 | 低 | GitHub/K2-FSA官方来源,HTTPS传输,建议校验SHA256 |
| 来源可信度 | 中 | T3社区项目,需关注后续更新 |
| 依赖可用性 | 中 | sherpa-onnx/ffmpeg/aplay缺一不可 |

建议首次使用前审查 ~/.local/bin/jarvis 脚本内容,确认无额外网络/文件操作。

TinkerClaw Jarvis Voice 内容

templates文件夹
手动下载zip · 7.9 kB
HUMOR.mdtext/markdown
请选择文件