Speech to Text (Yandex SpeechKit)

🎙️ 语音消息一键转文字

将语音消息转录为文本,集成 Yandex SpeechKit API,支持多格式音频处理与多语言识别。

收藏
4.5k
安装
1.2k
版本
1.0.4
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

sergei-mikhailov-stt 是 OpenClaw 生态中的语音转文本(STT)技能,用于将用户发送的语音消息自动转录为可读的文本内容。核心流程包括:接收本地音频文件路径 → 格式验证与 ffmpeg 转码 → 调用 Yandex SpeechKit 或其他 STT 服务商进行语音识别 → 返回带置信度和语言标签的文本结果。

显著优点

  • 即装即用:支持 OGG、WAV、MP3、M4A、FLAC、AAC 等主流音频格式,自动转码
  • 多语言支持:内置俄语(ru-RU)和英语(en-US)识别,可扩展更多语言
  • 可插拔架构:提供标准化 Provider 基类,便于接入 Whisper、Google Speech 等其他引擎
  • 详细元数据:返回置信度、处理时长、识别引擎等结构化信息

潜在局限与风险

  • 服务商锁定:默认依赖 Yandex SpeechKit,需配置 YANDEX_API_KEY 和 YANDEX_FOLDER_ID,存在地缘政治与合规风险
  • 配额限制:Yandex SpeechKit v1 同步 API 单请求上限 1MB,大文件需分段处理
  • 本地依赖:必须预装 ffmpeg 和 Python 3.8+,配置门槛较高
  • 隐私敏感:语音数据上传至第三方云服务商,不适合处理机密内容

适合人群

  • 需要将 Telegram、WhatsApp 等 IM 语音消息自动化处理的开发者
  • 俄语/英语为主的客服、会议记录场景用户
  • 具备 Linux/服务器运维能力的技术人员

常规风险

  • API 密钥泄露风险(需妥善保管 openclaw.json)
  • 服务商限流或区域访问受限
  • 大文件处理超时(最长 5 分钟)
  • 离线场景完全不可用

Speech to Text (Yandex SpeechKit) 内容

assets文件夹
scripts文件夹
providers文件夹
手动下载zip · 19.1 kB
config.example.jsonapplication/json
请选择文件