核心用法
该技能为 OpenClaw 平台提供语音转文字(STT)能力,核心流程包括:接收音频文件 → FFmpeg 格式转换 → Yandex SpeechKit API 识别 → 返回文本结果。支持 OGG/WAV/MP3/M4A/FLAC/AAC 等格式,默认俄语(ru-RU)和英语(en-US)识别。
显著优点
1. 架构可扩展:采用 Provider 模式设计,可便捷接入其他 STT 服务(如 Google Speech-to-Text、Azure 等)
2. 配置灵活:支持 OpenClaw 全局配置、.env 文件、config.json 三级配置体系
3. 错误处理完善:内置 9 类常见错误场景的用户友好提示与修复指引
4. 诊断工具完备:提供 check.sh 一键检测环境依赖、API 密钥状态
潜在局限
- 硬性限制:Yandex SpeechKit v1 同步 API 仅支持 1MB 音频(约 30 秒语音),长语音需切割处理
- 语言覆盖窄:仅官方支持俄/英双语,小语种需切换 Provider
- 网络依赖强:识别延迟 2-5 秒,API 限流时可能触发 429 错误
- 隐私考量:音频数据上传至 Yandex Cloud,敏感场景需评估合规性
适合人群
- OpenClaw 个人用户:需将 IM 语音消息快速转为文字
- 小型团队:部署内部机器人处理语音指令
- 开发者:需要可扩展的 STT 基础设施进行二次开发
常规风险
API 密钥泄露风险(需妥善保管 YANDEX_API_KEY);依赖外部服务可用性;FFmpeg 本地执行存在文件系统操作风险,但已限制为只读音频处理。