核心用法
该技能为 OpenClaw 框架提供语音转文本(STT)能力,主要处理来自即时通讯工具的语音消息。核心工作流程包括:接收音频文件路径(支持 OGG、WAV、MP3 等格式)、通过 FFmpeg 进行格式转换与质量验证、调用 Yandex SpeechKit API 执行识别、返回结构化文本结果。
使用时需通过 python3 /absolute/path/to/scripts/stt_processor.py --file "/path/to/audio.ogg" 绝对路径调用,避免触发安全审批。支持通过 ~/.openclaw/openclaw.json 或 .env 文件配置 API 凭证,默认语言为俄语(ru-RU),可选英语(en-US)。
显著优点
架构可扩展性:采用基类抽象设计(BaseSTTProvider),开发者可通过实现 recognize()、validate_config()、get_supported_formats() 方法快速接入新提供商(如 Google Cloud Speech、Azure Speech 等),无需修改核心处理逻辑。
多格式兼容:内置 FFmpeg 转换层,原生支持 OGG、WAV、MP3、M4A、FLAC、AAC 六种格式,降低用户预处理成本。
完善的诊断工具:提供 check.sh 脚本一键检测 Python 环境、FFmpeg、虚拟环境、依赖包及 API 密钥配置,显著降低部署门槛。
细粒度的错误映射:将技术错误(HTTP 401/403/429、FFmpeg 缺失等)转化为用户友好的中文提示,并附带明确的修复指引。
潜在缺点与局限性
严格的容量限制:Yandex SpeechKit v1 同步 API 单文件上限 1 MB(约 30 秒语音),长语音需手动切片或等待异步 API 支持。
厂商锁定风险:当前默认实现深度依赖 Yandex Cloud 服务,需有效的俄罗斯区或国际区 Yandex 账户;服务可用性受地缘政治及厂商政策影响。
语言覆盖有限:当前仅验证俄语、英语支持,小语种及方言识别质量未明确,多语言混合场景未提及处理策略。
超时风险:文档标注最大处理时间 5 分钟,网络波动时用户体验可能中断。
适合人群
- 俄语/英语为主要工作语言的 OpenClaw 用户:需要快速将 Telegram、微信等平台的语音消息转为可搜索文本。
- 具备基础 Linux 运维能力的自托管用户:能够独立完成 FFmpeg、Python 虚拟环境部署及 API 密钥管理。
- 有二次开发需求的开发者:希望基于可扩展架构集成私有化部署的 STT 引擎(如 Whisper、Kaldi)。
常规风险
凭证泄露风险:技能要求配置 YANDEX_API_KEY 与 YANDEX_FOLDER_ID,若用户误将 .env 或 openclaw.json 提交至版本控制,可能导致云服务资源滥用及费用损失。文档已强调「绝不向用户展示 API 密钥」,但依赖用户自觉遵守。
音频隐私合规:语音数据上传至 Yandex Cloud 进行处理,涉及跨境数据传输,企业用户需评估 GDPR、数据主权等合规要求。
依赖链脆弱性:FFmpeg 为系统级依赖,不同发行版版本差异可能导致格式转换行为不一致;Python 虚拟环境若未正确隔离,可能引发依赖冲突。
速率限制影响业务:Yandex SpeechKit 存在请求频率限制(HTTP 429),高并发场景下可能出现服务降级,需自行实现退避重试机制。