Speech to Text (Yandex SpeechKit)

️ 语音消息秒转文字,俄语识别更精准

基于 Yandex SpeechKit 的语音转文本技能,支持多格式音频识别,30 秒短语音即时转写,可扩展接入其他 STT 服务商。

收藏
5.2k
安装
1.2k
版本
1.1.5
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Sergei Mikhailov STT 是 OpenClaw 生态的语音转文字技能,专门处理即时通讯场景中的语音消息转录。用户发送语音消息后,系统自动完成格式验证、音频转换(FFmpeg)、云端识别全流程,返回带置信度的文本结果。

工作流程:接收本地音频路径 → 验证格式与大小(≤1MB/约30秒)→ FFmpeg 预处理 → 调用 Yandex SpeechKit v1 同步 API → 返回结构化结果(文本/语言/置信度/耗时)。支持 OGG、WAV、MP3、M4A、FLAC、AAC 格式,默认俄英双语(ru-RU/en-US),架构预留多提供商扩展接口。

显著优点

  • 开箱即用:提供 setup.sh 一键配置虚拟环境与依赖,check.sh 诊断脚本覆盖 Python、FFmpeg、API 密钥全链路检测
  • 企业级识别引擎:背靠 Yandex SpeechKit,俄语识别准确率处于行业第一梯队
  • 灵活配置:支持 OpenClaw 全局配置、本地 .env、JSON 配置文件三级注入方式,便于多环境部署
  • 可扩展架构:基于 BaseSTTProvider 抽象类,新增提供商仅需实现 recognize/validate_config/get_supported_formats 三接口
  • 精细化错误映射:10 类典型错误(文件过大、401/403/429、FFmpeg 缺失等)全部转化为用户友好的自然语言提示与具体操作指引

潜在缺点与局限性

  • 硬性容量天花板:Yandex v1 同步 API 限制 1MB/约30秒,长语音需人工分段或等待 v3 异步接口支持
  • 生态依赖重:强制绑定 Python 3.8+、FFmpeg 系统二进制及 Yandex Cloud 服务账号(需 ai.speechkit.user IAM 角色),Windows 原生部署成本较高
  • 语言覆盖有限:默认仅俄英双语,小语种需自行接入第三方提供商
  • 延迟敏感:端到端处理依赖网络往返,弱网环境下 5 分钟超时阈值可能触发失败

适合人群

  • 俄语/英语为主要工作语言的 OpenClaw 用户(客服、社群运营、个人助理场景)
  • 已入驻 Yandex Cloud、具备服务账号管理经验的开发者或团队
  • 需要私有化部署语音处理、不愿接入国际云(Google/AWS)的合规敏感组织
  • 具备 Python 开发能力、计划定制化扩展其他 STT 引擎(如 Whisper、阿里云)的技术用户

常规风险

  • 密钥泄露风险:API 密钥以明文存储于本地 JSON/ENV 文件,多用户服务器需严格管控文件权限(建议 600
  • 隐私合规边界:音频数据流经 Yandex Cloud 俄罗斯/欧盟节点,涉及敏感内容的语音需评估数据主权合规性
  • 速率限制突发:Yandex SpeechKit 免费档 QPS 限制较严,高并发场景可能触发 429 错误,需设计指数退避重试
  • FFmpeg 供应链风险:依赖系统级二进制,若通过非官方源安装可能引入编解码器漏洞,建议锁定版本并校验签名

Speech to Text (Yandex SpeechKit) 内容

assets文件夹
scripts文件夹
providers文件夹
手动下载zip · 23.4 kB
config.example.jsonapplication/json
请选择文件