核心用法
mlx-whisper 是专为 Apple Silicon(M1/M2/M3/M4)设计的本地语音转录技能,为 OpenClaw 提供零依赖、零费用的语音消息处理能力。用户通过 Telegram 或 WhatsApp 发送语音消息后,系统自动下载音频文件(.ogg 或 .opus 格式),调用本地 mlx-whisper-transcribe.sh 脚本完成转录,并将文本内容注入对话流程供 Agent 处理。
部署流程包含三步:通过 pip 安装 mlx-whisper 包、将封装脚本复制到 Python 用户目录并赋予执行权限,最后在 ~/.openclaw/openclaw.json 中配置音频处理工具链。首次运行需联网下载约 465MB 的 whisper-small-mlx 模型,后续完全离线可用。
显著优点
极致性能优化:依托 Apple MLX 机器学习框架,转录速度较标准 Whisper 提升约 60 倍。实测 M3 MacBook Pro 处理 1 分钟音频仅需 7 秒,30 分钟音频约 3.5 分钟完成。
零成本隐私保障:无需 OpenAI、Google 等第三方 API 密钥,语音数据全程本地处理,彻底消除云端传输的隐私泄露风险,适合对数据主权敏感的个人与企业场景。
灵活模型配置:提供 tiny(75MB)到 large-v3(3GB)四档模型,可在速度与精度间按需取舍,并支持语言代码强制指定以跳过自动检测、进一步加速。
潜在缺点与局限性
硬件门槛严格:仅支持 macOS Darwin 系统的 Apple Silicon 设备,Intel Mac 及 Windows/Linux 平台完全无法运行,生态封闭性显著。
初始部署复杂度:需用户手动完成 Python 环境验证、脚本路径配置、JSON 工具链注册等多步操作,对非技术用户存在门槛。
功能边界明确:Whisper 模型本质为语音转文字,无法识别音乐内容,对极低信噪比、浓重口音或专业术语的转录准确率会下降。
适合的目标群体
- Apple Silicon 重度用户:已深度使用 Mac 生态、追求本地优先(Local-First)工作流的效率极客
- 隐私敏感型团队:律师、医疗、金融等合规要求严苛行业,需确保语音数据不出本地设备
- 高频语音沟通者:习惯通过 Telegram/WhatsApp 发送语音消息、希望自动归档为可搜索文本的知识工作者
- 低预算开发者:不愿承担云端 API 持续调用的 Token 成本,接受一次性硬件投入的独立开发者
使用风险
依赖管理风险:技能依赖 python3、pip3 及特定版本的 mlx-whisper 包,系统 Python 环境冲突或 MLX 框架更新可能导致功能失效。
存储与缓存占用:模型首次下载需约 465MB 流量与本地存储,多模型共存时缓存可达数 GB,长期运行需关注 ~/.cache/huggingface 目录膨胀。
超时与容错:默认 60 秒超时限制可能无法覆盖超长音频(如 1 小时以上会议录音),需手动调整配置;网络异常仅影响首次模型下载,但无优雅降级方案。
维护可持续性:作为社区驱动技能,后续兼容性依赖 OpenClaw 与 mlx-whisper 上游项目的同步更新,长期稳定性需持续验证。