Speech to Text (Yandex SpeechKit)

🎙️ 语音秒转文字,沟通更高效

基于 Yandex SpeechKit 的语音转文本技能,支持多格式音频转录,适合集成 OpenClaw 的语音消息处理场景。

收藏
4.1k
安装
1.2k
版本
1.1.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

sergei-mikhailov-stt 是专为 OpenClaw 设计的语音转文本(STT)技能,用于将即时通讯中的语音消息转换为可读的文本内容。该技能通过接收本地音频文件路径,经 FFmpeg 预处理后调用 Yandex SpeechKit API 完成识别,最终返回结构化文本结果。

显著优点

  • 多格式支持:原生兼容 OGG、WAV、MP3、M4A、FLAC、AAC 等主流音频格式
  • 灵活部署:支持通过 OpenClaw 全局配置或本地 .env 文件双轨配置 API 密钥
  • 可扩展架构:基于基类模式设计,便于接入其他 STT 服务商(如 Google、Azure)
  • 详细元数据:返回置信度、语言标识、处理时长等结构化信息
  • 完善错误映射:将技术错误(HTTP 401/403/429)转化为用户友好的提示与修复建议

潜在缺点与局限性

  • 服务商锁定:默认仅实现 Yandex SpeechKit,其他 provider 需自行开发
  • 硬性容量限制:单文件 50MB 上限,Yandex API 单次请求仅 1MB,长音频需分片处理
  • 语言覆盖有限:官方明确仅支持俄语(ru-RU)和英语(en-US)
  • 自托管复杂度:依赖 FFmpeg 与 Python 虚拟环境,对非技术用户门槛较高
  • 延迟敏感:处理耗时可达 5 分钟,实时性场景受限

适合人群

  • OpenClaw 自托管用户:希望为个人或团队机器人添加语音消息转录能力
  • 俄语/英语工作流:主要处理这两种语言的语音内容
  • 隐私优先场景:倾向使用 Yandex Cloud 而非西方云服务商的企业用户

常规风险

  • 密钥泄露风险:API 密钥以明文存储于 JSON 配置文件,需确保文件权限(建议 600)
  • 成本不可控:Yandex SpeechKit 按用量计费,高频使用可能产生意外费用
  • 服务可用性:依赖 Yandex Cloud 区域可用性,国际网络环境可能不稳定
  • 音频质量敏感:背景噪音、方言、专业术语识别准确率显著下降

技术实现要点

用户语音消息 → OpenClaw 媒体存储 → FFmpeg 格式验证 → Yandex SpeechKit → 结构化文本返回

支持通过 config.json 自定义默认语言、provider 参数及备用识别策略。

Speech to Text (Yandex SpeechKit) 内容

assets文件夹
scripts文件夹
providers文件夹
手动下载zip · 19.9 kB
config.example.jsonapplication/json
请选择文件