Speech to Text (Yandex SpeechKit)

🎙️ 语音秒转文字,支持多格式与扩展

基于 Yandex SpeechKit 的语音转文字技能,支持多格式音频处理,可扩展至其他 STT 服务商,适合 OpenClaw 消息机器人集成。

收藏
5.1k
安装
1.2k
版本
1.1.6
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

sergei-mikhailov-stt 是一款专为 OpenClaw 框架设计的语音转文字(STT)技能,核心功能是将用户发送的语音消息自动转换为可读的文本内容。该技能采用 Yandex SpeechKit 作为默认识别引擎,同时预留了可扩展的架构,允许开发者接入其他第三方 STT 服务商(如 Google Cloud Speech-to-Text、Azure Speech Services 等)。

典型使用流程
1. 用户通过任意已接入 OpenClaw 的即时通讯应用发送语音消息

2. OpenClaw 将音频文件传递至本地技能工作目录

3. 技能自动校验音频格式(OGG/WAV/MP3/M4A/FLAC/AAC)与文件大小(≤1MB)

4. 必要时调用 FFmpeg 进行格式转换

5. 通过 Yandex SpeechKit API 提交识别请求

6. 返回结构化结果:识别文本、检测语言、置信度分数、处理耗时

配置方式灵活,支持通过 OpenClaw 主配置文件(~/.openclaw/openclaw.json)注入环境变量,也可使用本地 .env 文件。技能提供 setup.sh 一键初始化脚本与 check.sh 诊断工具,大幅降低部署门槛。

显著优点

  • 即插即用的集成体验:与 OpenClaw 深度耦合,自动处理文件路径、错误兜底、结果格式化,开发者无需编写额外代码
  • 多格式兼容性:原生支持 6 种主流音频格式,内置 FFmpeg 转换流水线
  • 可扩展架构:基于抽象基类 BaseSTTProvider 设计,新增服务商仅需实现 recognize()validate_config()get_supported_formats() 三个方法
  • 完善的错误映射:将技术错误(HTTP 401/403/429、FFmpeg 缺失等)转化为用户友好提示,避免暴露敏感信息
  • 双语支持:内置俄语(ru-RU)与英语(en-US)识别优化

潜在缺点与局限性

| 限制项 | 说明 |
|--------|------|
| 文件大小上限 | 1MB(Yandex SpeechKit v1 同步 API 硬性限制),约对应 30 秒语音 |
| 音频时长上限 | 官方文档标注 30 分钟,但实际受 1MB 限制约束 |
| 处理延迟 | 同步 API 模式下,复杂音频可能耗时 5 分钟 |
| 语言覆盖 | 当前仅验证俄语、英语,其他语言需自行测试 |
| 网络依赖 | 完全依赖云端 API,离线环境不可用 |
| 隐私考量 | 音频数据需上传至 Yandex Cloud,涉及跨境数据传输 |

适合人群

  • OpenClaw 生态用户:已部署 OpenClaw 网关,需要为聊天机器人增加语音交互能力
  • 俄语/英语场景开发者:面向俄语区或双语用户的客服、助手类应用
  • 中小型项目团队:需要快速验证 STT 功能,暂不具备自研语音识别引擎能力
  • 多服务商对比测试者:希望以 Yandex 为基线,逐步评估迁移至其他云服务商

常规风险

1. API 密钥泄露风险YANDEX_API_KEYYANDEX_FOLDER_ID 以明文形式存储于配置文件,共享服务器或代码仓库时需注意权限控制
2. 成本失控风险:Yandex SpeechKit 按请求时长计费,高频场景需设置配额监控

3. 服务可用性风险:俄罗斯境外网络访问 Yandex Cloud 可能存在延迟或间歇性阻断,建议实现降级逻辑

4. 数据合规风险:涉及个人生物特征信息(语音)的采集,需符合 GDPR、《个人信息保护法》等法规要求

5. 依赖维护风险:FFmpeg 版本差异可能导致特定格式解码失败,建议锁定版本并测试

Speech to Text (Yandex SpeechKit) 内容

assets文件夹
scripts文件夹
providers文件夹
手动下载zip · 23.5 kB
config.example.jsonapplication/json
请选择文件