Speech to Text (Yandex SpeechKit)

🎙️ 语音消息一键转文字,多格式兼容

基于 Yandex SpeechKit 的语音消息转文字技能,支持多格式音频处理,30秒短语音识别准确率较高,适合即时通讯场景。

收藏
2.5k
安装
1.2k
版本
1.1.2
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

sergei-mikhailov-stt 是 OpenClaw 框架下的语音转文字(STT)技能,核心功能是将用户发送的语音消息自动转换为可编辑文本。技能采用可扩展架构,当前默认集成 Yandex SpeechKit,开发者可按规范接入其他 STT 服务商。

显著优点

1. 架构灵活:基于 Python 抽象基类设计,新增提供商仅需实现 recognize()validate_config() 等 3 个方法即可接入
2. 格式兼容性强:通过 FFmpeg 预处理,原生支持 OGG、WAV、MP3、M4A、FLAC、AAC 等常见格式

3. 配置管理规范:支持 OpenClaw 全局配置(openclaw.json)、环境变量(.env)、JSON 配置文件三级配置,便于多环境部署

4. 错误处理人性化:将技术错误映射为用户友好话术(如 HTTP 401 → "API key 有问题"),降低运营摩擦

潜在缺点与局限性

  • 硬性容量限制:Yandex SpeechKit v1 同步 API 仅支持 1MB 音频(约 30 秒语音),长语音需人工分段或等待 v2 API 支持
  • 依赖链较重:需同时维护 Python 3.8+、FFmpeg、虚拟环境及 API 密钥,对非技术用户部署门槛较高
  • 语言覆盖有限:当前仅验证俄语(ru-RU)和英语(en-US),小语种需自行测试
  • 云服务商锁定:默认提供商为俄罗斯 Yandex Cloud,地缘政治因素可能影响服务连续性

适合人群

  • OpenClaw 生态用户:已在运行 OpenClaw 网关的 Telegram/Discord 等机器人运营者
  • 俄语区开发者:Yandex SpeechKit 对俄语识别优化较好,适合俄语文档转录、客服场景
  • 有自托管需求的技术团队:可接受本地 FFmpeg+Python 栈,不愿使用 SaaS 化语音 API

常规风险

| 风险类别 | 具体表现 | 缓解建议 |
|---------|---------|---------|
| 密钥泄露 | API key 明文存储于 JSON 配置文件 | 使用 OpenClaw 的密钥注入机制,避免提交至 Git |
| 成本失控 | Yandex SpeechKit 按调用量计费 | 启用网关级速率限制,监控异常高频调用 |
| 隐私合规 | 语音数据上传至 Yandex 云端 | 评估数据本地化要求,敏感场景改用本地 Whisper 模型 |
| 服务中断 | FFmpeg 或 Python 环境损坏 | 容器化部署,固定依赖版本 |

---

总结:该技能适合作为 OpenClaw 机器人的"耳朵"处理短语音指令,技术团队可基于其扩展架构接入 Whisper、Azure Speech 等替代方案以突破 30 秒限制。

Speech to Text (Yandex SpeechKit) 内容

assets文件夹
scripts文件夹
providers文件夹
手动下载zip · 21.2 kB
config.example.jsonapplication/json
请选择文件