Speech to Text (Yandex SpeechKit)

🎙️ 语音消息秒转文字,准确高效

Yandex SpeechKit 语音转文字技能,支持多格式音频转录,30秒语音实时识别,准确率约95%,适合消息转文字场景。

收藏
5.3k
安装
1.2k
版本
1.1.3
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

该技能为 OpenClaw 平台提供语音转文字(STT)能力,核心流程包括:接收音频文件 → FFmpeg 格式转换 → Yandex SpeechKit API 识别 → 返回文本结果。支持 OGG/WAV/MP3/M4A/FLAC/AAC 等格式,默认俄语(ru-RU)和英语(en-US)识别。

显著优点

1. 架构可扩展:采用 Provider 模式设计,可便捷接入其他 STT 服务(如 Google Speech-to-Text、Azure 等)
2. 配置灵活:支持 OpenClaw 全局配置、.env 文件、config.json 三级配置体系

3. 错误处理完善:内置 9 类常见错误场景的用户友好提示与修复指引

4. 诊断工具完备:提供 check.sh 一键检测环境依赖、API 密钥状态

潜在局限

  • 硬性限制:Yandex SpeechKit v1 同步 API 仅支持 1MB 音频(约 30 秒语音),长语音需切割处理
  • 语言覆盖窄:仅官方支持俄/英双语,小语种需切换 Provider
  • 网络依赖强:识别延迟 2-5 秒,API 限流时可能触发 429 错误
  • 隐私考量:音频数据上传至 Yandex Cloud,敏感场景需评估合规性

适合人群

  • OpenClaw 个人用户:需将 IM 语音消息快速转为文字
  • 小型团队:部署内部机器人处理语音指令
  • 开发者:需要可扩展的 STT 基础设施进行二次开发

常规风险

API 密钥泄露风险(需妥善保管 YANDEX_API_KEY);依赖外部服务可用性;FFmpeg 本地执行存在文件系统操作风险,但已限制为只读音频处理。

Speech to Text (Yandex SpeechKit) 内容

assets文件夹
scripts文件夹
providers文件夹
手动下载zip · 23.2 kB
config.example.jsonapplication/json
请选择文件