核心用法
VoiceClaw 是专为 OpenClaw 代理设计的纯离线语音 I/O 系统,实现双向语音处理能力:
- 语音输入 (STT):通过 whisper.cpp 本地运行 Whisper
ggml-base.en.bin模型,将音频文件(支持 ogg/mp3/m4a/wav/flac)转录为文本 - 语音输出 (TTS):通过 Piper 引擎将文本合成为自然语音,支持 8 种英语音色
典型工作流程:接收语音消息 → 调用 transcribe.sh 转录 → 生成回复 → 调用 speak.sh 合成语音 → ffmpeg 转换为 OGG Opus 格式 → 发送语音+文本双回复。
显著优点
1. 零网络依赖:脚本执行期间完全不发起网络请求,所有推理在本地设备完成
2. 隐私零泄露:语音数据无需上传云端,杜绝第三方监听与数据留存风险
3. 零 API 成本:无需 OpenAI、Azure 等云服务商密钥,无用量计费
4. 快速响应:本地推理延迟可控,不受网络波动影响
5. 多格式支持:ffmpeg 自动处理常见音频格式转换
6. 开源可审计:基于 whisper.cpp 和 Piper,代码完全透明
潜在局限
| 局限类型 | 具体说明 |
|---------|---------|
| 语言限制 | 当前仅优化支持英语,其他语言需更换模型 |
| 模型体积 | Whisper 基础模型约 150MB,Piper 语音模型各约 50-100MB |
| 硬件要求 | 需要足够的 CPU/GPU 资源进行本地推理 |
| 安装复杂度 | 需手动安装 3 个二进制文件并下载模型,非一键部署 |
| 音色选择 | 仅内置 8 种英语预设音色,无法自定义训练 |
| 上下文长度 | 建议语音回复控制在 200 词以内,过长文本合成质量下降 |
适合人群
- 隐私敏感型用户:医疗、法律、金融从业者处理敏感语音信息
- 离线环境部署:内网隔离、无公网访问权限的服务器场景
- 成本控制场景:高频语音交互需求,希望消除按量计费
- 技术爱好者:具备 Linux 命令行基础,愿意维护本地推理环境
常规风险
| 风险类别 | 等级 | 说明 |
|---------|------|------|
| 数据泄露 | 极低 | 本地处理,无网络传输 |
| 依赖可用性 | 中等 | 需确保二进制文件和模型文件存在,否则技能失效 |
| 推理错误 | 中等 | 本地模型准确度可能低于云端大模型,专业术语识别有误 |
| 存储占用 | 低 | 模型文件总计约 200-500MB |
| 环境配置 | 中等 | PATH、环境变量配置不当导致二进制无法调用 |
> 关键安全承诺:技能脚本执行期间 transcribe.sh 和 speak.sh 均不发起任何网络请求,仅在首次设置时需要下载模型文件。