VoiceClaw

🎙️ 本地离线语音交互 · 零云端依赖

本地离线语音交互方案,基于Whisper与Piper实现零云端依赖的语音识别与合成,适合隐私敏感场景。

收藏
4.9k
安装
1k
版本
1.0.6
CLS 安全扫描中
预计需要 3 分钟...

使用说明

VoiceClaw 综合评估

核心用法:VoiceClaw 是一套为 OpenClaw 智能体设计的本地语音 I/O 基础设施,实现完全离线的语音识别(STT)与语音合成(TTS)。接收端通过 whisper.cpp 本地二进制文件将音频消息转录为文本;输出端通过 piper 本地 TTS 引擎生成自然语音回复。两者均运行于用户设备,不依赖任何云 API 或网络连接。

显著优点

  • 零隐私泄露风险:所有推理在本地执行,音频数据永不离开设备,符合医疗、金融等强隐私合规场景
  • 零 API 成本:无需订阅 Azure Speech、AWS Polly 等云服务,无用量计费担忧
  • 确定性延迟:本地推理延迟可预测,不受网络波动影响
  • 环境可控:支持自定义模型路径与语音包,便于企业级定制部署

潜在缺点与局限性

  • 部署门槛高:需手动安装 whisper、piper、ffmpeg 及模型文件,配置流程复杂
  • 硬件依赖:Whisper 转录需充足 CPU/GPU 资源,低配置设备可能出现卡顿
  • 语言支持受限:默认仅捆绑英语模型(ggml-base.en),多语言需额外下载对应模型
  • 模型体积:Whisper base 模型约 150MB,Piper 语音包单个 50-100MB,对存储敏感
  • 语音自然度:Piper 为轻量级神经网络 TTS,音质逊于商用云端方案(如 ElevenLabs)

适合人群

  • 注重数据主权的隐私极客与企业安全团队
  • 需要离线运行的边缘计算/IoT 场景开发者
  • 希望消除外部 API 依赖以降低运维复杂度的技术团队
  • 对响应延迟敏感、需本地化部署的语音交互应用

常规风险

  • 二进制与模型版本不匹配可能导致转录失败
  • 未配置正确的 ffmpeg 编码参数时,Telegram 等平台的语音消息可能无法播放
  • 环境变量未正确设置时,技能将静默回退到自动检测,可能加载非预期模型
  • 语音合成长度建议控制在 200 词以内,过长文本将显著增加推理时间并可能导致断句不自然

VoiceClaw 内容

scripts文件夹
手动下载zip · 9.9 kB
speak.shtext/x-shellscript
请选择文件