VoiceClaw

🔊 离线语音交互,隐私零泄露

离线语音交互解决方案,基于本地Whisper和Piper实现零网络依赖的语音转文字与文字转语音,无需API密钥,保障隐私安全。

收藏
5.1k
安装
1k
版本
1.0.5
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

VoiceClaw 是专为 OpenClaw 代理设计的纯离线语音 I/O 系统,实现双向语音处理能力:

  • 语音输入 (STT):通过 whisper.cpp 本地运行 Whisper ggml-base.en.bin 模型,将音频文件(支持 ogg/mp3/m4a/wav/flac)转录为文本
  • 语音输出 (TTS):通过 Piper 引擎将文本合成为自然语音,支持 8 种英语音色

典型工作流程:接收语音消息 → 调用 transcribe.sh 转录 → 生成回复 → 调用 speak.sh 合成语音 → ffmpeg 转换为 OGG Opus 格式 → 发送语音+文本双回复。

显著优点

1. 零网络依赖:脚本执行期间完全不发起网络请求,所有推理在本地设备完成
2. 隐私零泄露:语音数据无需上传云端,杜绝第三方监听与数据留存风险

3. 零 API 成本:无需 OpenAI、Azure 等云服务商密钥,无用量计费

4. 快速响应:本地推理延迟可控,不受网络波动影响

5. 多格式支持:ffmpeg 自动处理常见音频格式转换

6. 开源可审计:基于 whisper.cpp 和 Piper,代码完全透明

潜在局限

| 局限类型 | 具体说明 |
|---------|---------|
| 语言限制 | 当前仅优化支持英语,其他语言需更换模型 |
| 模型体积 | Whisper 基础模型约 150MB,Piper 语音模型各约 50-100MB |
| 硬件要求 | 需要足够的 CPU/GPU 资源进行本地推理 |
| 安装复杂度 | 需手动安装 3 个二进制文件并下载模型,非一键部署 |
| 音色选择 | 仅内置 8 种英语预设音色,无法自定义训练 |
| 上下文长度 | 建议语音回复控制在 200 词以内,过长文本合成质量下降 |

适合人群

  • 隐私敏感型用户:医疗、法律、金融从业者处理敏感语音信息
  • 离线环境部署:内网隔离、无公网访问权限的服务器场景
  • 成本控制场景:高频语音交互需求,希望消除按量计费
  • 技术爱好者:具备 Linux 命令行基础,愿意维护本地推理环境

常规风险

| 风险类别 | 等级 | 说明 |
|---------|------|------|
| 数据泄露 | 极低 | 本地处理,无网络传输 |
| 依赖可用性 | 中等 | 需确保二进制文件和模型文件存在,否则技能失效 |
| 推理错误 | 中等 | 本地模型准确度可能低于云端大模型,专业术语识别有误 |
| 存储占用 | 低 | 模型文件总计约 200-500MB |
| 环境配置 | 中等 | PATH、环境变量配置不当导致二进制无法调用 |

> 关键安全承诺:技能脚本执行期间 transcribe.shspeak.sh不发起任何网络请求,仅在首次设置时需要下载模型文件。

VoiceClaw 内容

scripts文件夹
手动下载zip · 8.3 kB
speak.shtext/x-shellscript
请选择文件