核心用法
sergei-mikhailov-stt 是专为 OpenClaw 设计的语音转文本(STT)技能,用于将即时通讯中的语音消息转换为可读的文本内容。该技能通过接收本地音频文件路径,经 FFmpeg 预处理后调用 Yandex SpeechKit API 完成识别,最终返回结构化文本结果。
显著优点
- 多格式支持:原生兼容 OGG、WAV、MP3、M4A、FLAC、AAC 等主流音频格式
- 灵活部署:支持通过 OpenClaw 全局配置或本地
.env文件双轨配置 API 密钥 - 可扩展架构:基于基类模式设计,便于接入其他 STT 服务商(如 Google、Azure)
- 详细元数据:返回置信度、语言标识、处理时长等结构化信息
- 完善错误映射:将技术错误(HTTP 401/403/429)转化为用户友好的提示与修复建议
潜在缺点与局限性
- 服务商锁定:默认仅实现 Yandex SpeechKit,其他 provider 需自行开发
- 硬性容量限制:单文件 50MB 上限,Yandex API 单次请求仅 1MB,长音频需分片处理
- 语言覆盖有限:官方明确仅支持俄语(ru-RU)和英语(en-US)
- 自托管复杂度:依赖 FFmpeg 与 Python 虚拟环境,对非技术用户门槛较高
- 延迟敏感:处理耗时可达 5 分钟,实时性场景受限
适合人群
- OpenClaw 自托管用户:希望为个人或团队机器人添加语音消息转录能力
- 俄语/英语工作流:主要处理这两种语言的语音内容
- 隐私优先场景:倾向使用 Yandex Cloud 而非西方云服务商的企业用户
常规风险
- 密钥泄露风险:API 密钥以明文存储于 JSON 配置文件,需确保文件权限(建议 600)
- 成本不可控:Yandex SpeechKit 按用量计费,高频使用可能产生意外费用
- 服务可用性:依赖 Yandex Cloud 区域可用性,国际网络环境可能不稳定
- 音频质量敏感:背景噪音、方言、专业术语识别准确率显著下降
技术实现要点
用户语音消息 → OpenClaw 媒体存储 → FFmpeg 格式验证 → Yandex SpeechKit → 结构化文本返回
支持通过 config.json 自定义默认语言、provider 参数及备用识别策略。