核心用法
sergei-mikhailov-stt 是 OpenClaw 生态中的语音转文本(STT)技能,用于将用户发送的语音消息自动转录为可读的文本内容。核心流程包括:接收本地音频文件路径 → 格式验证与 ffmpeg 转码 → 调用 Yandex SpeechKit 或其他 STT 服务商进行语音识别 → 返回带置信度和语言标签的文本结果。
显著优点
- 即装即用:支持 OGG、WAV、MP3、M4A、FLAC、AAC 等主流音频格式,自动转码
- 多语言支持:内置俄语(ru-RU)和英语(en-US)识别,可扩展更多语言
- 可插拔架构:提供标准化 Provider 基类,便于接入 Whisper、Google Speech 等其他引擎
- 详细元数据:返回置信度、处理时长、识别引擎等结构化信息
潜在局限与风险
- 服务商锁定:默认依赖 Yandex SpeechKit,需配置 YANDEX_API_KEY 和 YANDEX_FOLDER_ID,存在地缘政治与合规风险
- 配额限制:Yandex SpeechKit v1 同步 API 单请求上限 1MB,大文件需分段处理
- 本地依赖:必须预装 ffmpeg 和 Python 3.8+,配置门槛较高
- 隐私敏感:语音数据上传至第三方云服务商,不适合处理机密内容
适合人群
- 需要将 Telegram、WhatsApp 等 IM 语音消息自动化处理的开发者
- 俄语/英语为主的客服、会议记录场景用户
- 具备 Linux/服务器运维能力的技术人员
常规风险
- API 密钥泄露风险(需妥善保管 openclaw.json)
- 服务商限流或区域访问受限
- 大文件处理超时(最长 5 分钟)
- 离线场景完全不可用