Speech to Text (Yandex SpeechKit)

🎙️ 语音秒转文字,消息处理无忧

基于Yandex SpeechKit的语音转文字技能,支持多格式音频,可扩展架构适配其他STT服务商,适合消息机器人语音消息处理。

收藏
3.2k
安装
1.2k
版本
1.1.4
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

sergei-mikhailov-stt是OpenClaw框架下的语音转文字技能,主要功能是将即时通讯应用中的语音消息自动转录为文本。其核心工作流程为:接收音频文件→格式验证与转换→调用STT引擎识别→返回带置信度的文本结果。

该技能默认集成Yandex SpeechKit,但采用可扩展架构设计,开发者可通过继承BaseSTTProvider基类快速接入Google Cloud Speech、Azure Speech、Whisper等其他服务商。

显著优点

1. 多格式兼容性:原生支持OGG、WAV、MP3、M4A、FLAC、AAC,内置FFmpeg自动转码
2. 零配置快速启动:提供setup.sh一键初始化脚本,自动创建Python虚拟环境与依赖

3. 开发者友好:清晰的错误映射表(如HTTP 401→"API密钥无效"),内置check.sh诊断工具

4. 双语支持:俄语(ru-RU)与英语(en-US)识别优化

5. 结构化输出:返回包含语言、置信度、处理时长的完整元数据

潜在缺点与局限性

  • 严格容量限制:Yandex同步API仅支持1MB文件(约30秒语音),长音频需分割处理
  • 云依赖性强:完全依赖Yandex Cloud服务,存在网络延迟与服务商可用性风险
  • 部署复杂度:需独立维护Python 3.8+环境与FFmpeg二进制文件,对轻量级设备不友好
  • 语言覆盖窄:仅官方支持俄英双语,其他语言需自行扩展Provider

适合人群

  • OpenClaw用户:已部署OpenClaw网关、需要为Telegram/微信等机器人添加语音处理能力的开发者
  • 俄语区用户:Yandex SpeechKit在俄语识别准确率上具有地域优势
  • 自托管爱好者:偏好数据不经过第三方中转、可本地控制处理流程的技术团队

常规风险

| 风险类型 | 说明 | 缓释建议 |
|---------|------|---------|
| API密钥泄露 | 配置文件中明文存储YANDEX_API_KEY | 使用OpenClaw的env注入机制,避免提交至版本控制 |
| 成本失控 | Yandex SpeechKit按调用量计费 | 设置网关级速率限制,监控`processing_time`异常 |
| 隐私合规 | 语音数据上传至Yandex Cloud | 在技能文档中明确告知最终用户,提供关闭选项 |
| FFmpeg漏洞 | 依赖系统二进制可能引入CVE | 定期执行`apt/brew upgrade ffmpeg`,容器化部署时锁定版本 |

技术评估

该技能代码结构清晰,错误处理机制完善,但存在硬编码路径/home/user_folder/.openclaw/media/)与同步阻塞API设计。建议在生产环境中增加:

  • 异步队列处理长音频
  • 本地缓存层减少重复API调用
  • Provider健康检查与自动故障转移

Speech to Text (Yandex SpeechKit) 内容

assets文件夹
scripts文件夹
providers文件夹
手动下载zip · 23.4 kB
config.example.jsonapplication/json
请选择文件