Skill

🎤 开源离线语音,远程也能听

开源免费的跨平台 TTS 解决方案,支持 50+ 语音、30+ 语言,提供服务器端与本地端两种架构,适合 SSH 远程会话与多设备部署。

收藏
9.4k
安装
2.5k
版本
3.3.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能

AgentVibes OpenClaw 是一个基于 Piper TTS 的跨平台语音合成技能,提供两套灵活的部署架构:服务器端音频流模式(通过 PulseAudio 传输)与文本流模式(接收端本地合成,推荐方案)。支持 Linux、macOS、Android 及 WSL 环境,覆盖 30+ 语言的 50+ 高品质离线语音。

主要特性

| 维度 | 说明 |
|------|------|
| **零成本** | 完全免费,无 API 密钥、无订阅、无用量限制 |
| **离线运行** | Piper TTS 本地推理,无需网络连接 |
| **多平台** | 原生支持 macOS Say 作为备选,Windows 通过 WSL 兼容 |
| **语音管理** | 支持自定义语音添加、预览、切换、历史回放 |
| **远程友好** | 专为 SSH 会话、无显卡服务器、远程 AI Agent 设计 |

显著优势

1. 架构灵活性:推荐模式将计算压力转移至接收设备,服务器仅需传输文本,大幅降低远程带宽与云端成本
2. 语音生态丰富:内置英、法、德、西、日、中、韩等多语种优质声库,支持用户从 Piper 官方库导入自定义声音

3. 无缝集成:通过 /agent-vibes:* 命令集实现会话级静音、品牌前缀设置、多提供商切换等高级功能

4. 隐私安全:纯本地处理,无云端语音数据上传风险

局限性与注意事项

  • 硬件依赖:高质量语音合成需要一定本地算力,低配 Android 设备可能出现延迟
  • 配置门槛:Linux 需手动配置 PulseAudio 或 Piper 环境,对新手不够友好
  • 中文支持有限:中文语音仅 zh_CN-huayan-x_low 一档,质量与选择面不及英文
  • 无 Windows 原生支持:Windows 用户必须通过 WSL 间接使用

适合人群

  • 需要在无头服务器(headless server)上运行语音输出的开发者
  • 注重隐私、拒绝云端 TTS 服务的安全意识用户
  • 多语言内容创作者、无障碍需求用户、远程运维工程师

潜在风险

  • 来源可信度:项目依赖 Piper TTS 二进制与预训练模型,建议校验模型文件哈希值以防供应链攻击
  • 音频注入:若服务器端模式被恶意利用,可能通过 TTS 向本地环境推送音频内容,建议在可信网络内使用
  • 配置泄露:本地 .agentvibes/config/agentvibes.json 包含用户偏好,共享环境时需注意权限设置

安全解读

核心用法

Agent Vibes OpenClaw Skill 是一款专为远程 AI 代理、SSH 会话及多设备场景设计的语音管理工具。该技能采用纯 Markdown 文档架构,提供完整的 TTS(文本转语音)命令体系,支持两大主流提供商:Piper TTS(免费离线,跨平台)和 macOS Say(原生内置,Mac 专属)。用户可通过简洁的命令语法实现语音切换、预览、静音控制、自定义前缀设置等操作,无需编写代码即可完成复杂的语音管理工作流。

核心命令覆盖五大功能维度:语音控制(mute/unmute/switch/preview/replay)、提供商管理(provider list/switch/info)、自定义语音添加(基于 Piper 语音库 ID)、历史回放(保留最近 10 条音频)以及个性化前缀配置。特别设计的双架构部署方案——服务端音频流式传输或接收端文本流式生成——为不同网络环境和硬件条件提供了灵活选择。

显著优点

跨平台兼容性卓越:支持 Linux、macOS、WSL 及 Android 环境,打破传统 TTS 工具的系统壁垒。零成本门槛:Piper TTS 提供 50+ 免费离线声音,覆盖英语、中文、日语、法语、德语等 30+ 语言,无需 API Key 或订阅费用。安全架构设计:纯文档型 Skill(T-MD 层级),无可执行代码、无第三方依赖、无数据收集行为,通过 GDPR/CCPA 合规验证。远程场景优化:专为 SSH 会话和远程 Agent 设计,解决无音频设备服务器的语音输出难题。开发者友好:维护者 paulpreibisch 在生物信息学领域拥有多个成熟开源项目(RiboGalaxy、riboSeqR 等),技术背景可信。

潜在缺点与局限性

功能依赖外部服务:实际 TTS 生成依赖 Piper TTS 或 macOS 系统语音,本 Skill 仅提供命令封装与文档指引,不内置语音合成引擎。平台差异限制:macOS Say 提供商仅限苹果设备,Windows 原生支持缺失(需通过 WSL 间接使用)。自定义语音门槛:添加 Piper 自定义声音需用户自行前往 piper.io 获取 Voice ID,流程略显分散。无可视化界面:纯命令行交互模式,对图形界面偏好用户不够直观。离线场景局限:虽然 Piper 支持离线运行,但获取新语音库仍需网络访问官方资源。

适合的目标群体

远程开发与运维工程师:需要在 SSH 会话中获取语音反馈的 DevOps 从业者。AI Agent 开发者:为自主代理系统添加多语言语音交互能力的构建者。无障碍技术用户:依赖语音辅助的视障开发者或需要 TTS 工作流优化的效率追求者。多语言内容创作者:需要批量生成多语言音频素材的播客制作者、教育工作者。隐私敏感型用户:拒绝云端 API、追求完全本地化处理的数据安全倡导者。

使用风险与注意事项

运行时依赖风险:本 Skill 本身无代码执行,但实际使用需确保目标系统已正确安装 Piper TTS 或 macOS 语音引擎,版本不兼容可能导致命令失效。网络链接时效性:文档中引用的 piper.io 语音库链接可能随服务更新而变化,建议定期检查官方文档。音频设备配置:远程场景下需正确配置 PulseAudio 或类似音频转发机制,否则可能出现静音或播放失败。存储占用考量:Piper 语音模型文件体积从几十 MB 到数 GB 不等,大规模部署时需预留充足磁盘空间。来源可信度认知:虽然安全评级为 S+,但维护者为个人开发者(T3 来源),企业用户应评估是否满足内部安全审计要求。建议优先通过 OpenClaw 官方渠道获取更新,并关注社区反馈。

Skill 内容

手动下载zip · 2.6 kB
SKILL.mdtext/markdown
请选择文件