mlx-whisper

🎙️ Apple Silicon 本地语音转文字引擎

基于 Apple MLX 框架的本地化 Whisper 语音转录方案,专为 M 系列芯片优化,无需 API 密钥、完全离线运行,速度提升 60 倍。

收藏
3.5k
安装
823
版本
1.0.7
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

mlx-whisper 是专为 Apple Silicon(M1/M2/M3/M4)设计的本地语音转录技能,为 OpenClaw 提供零依赖、零费用的语音消息处理能力。用户通过 Telegram 或 WhatsApp 发送语音消息后,系统自动下载音频文件(.ogg.opus 格式),调用本地 mlx-whisper-transcribe.sh 脚本完成转录,并将文本内容注入对话流程供 Agent 处理。

部署流程包含三步:通过 pip 安装 mlx-whisper 包、将封装脚本复制到 Python 用户目录并赋予执行权限,最后在 ~/.openclaw/openclaw.json 中配置音频处理工具链。首次运行需联网下载约 465MB 的 whisper-small-mlx 模型,后续完全离线可用。

显著优点

极致性能优化:依托 Apple MLX 机器学习框架,转录速度较标准 Whisper 提升约 60 倍。实测 M3 MacBook Pro 处理 1 分钟音频仅需 7 秒,30 分钟音频约 3.5 分钟完成。

零成本隐私保障:无需 OpenAI、Google 等第三方 API 密钥,语音数据全程本地处理,彻底消除云端传输的隐私泄露风险,适合对数据主权敏感的个人与企业场景。

灵活模型配置:提供 tiny(75MB)到 large-v3(3GB)四档模型,可在速度与精度间按需取舍,并支持语言代码强制指定以跳过自动检测、进一步加速。

潜在缺点与局限性

硬件门槛严格:仅支持 macOS Darwin 系统的 Apple Silicon 设备,Intel Mac 及 Windows/Linux 平台完全无法运行,生态封闭性显著。

初始部署复杂度:需用户手动完成 Python 环境验证、脚本路径配置、JSON 工具链注册等多步操作,对非技术用户存在门槛。

功能边界明确:Whisper 模型本质为语音转文字,无法识别音乐内容,对极低信噪比、浓重口音或专业术语的转录准确率会下降。

适合的目标群体

  • Apple Silicon 重度用户:已深度使用 Mac 生态、追求本地优先(Local-First)工作流的效率极客
  • 隐私敏感型团队:律师、医疗、金融等合规要求严苛行业,需确保语音数据不出本地设备
  • 高频语音沟通者:习惯通过 Telegram/WhatsApp 发送语音消息、希望自动归档为可搜索文本的知识工作者
  • 低预算开发者:不愿承担云端 API 持续调用的 Token 成本,接受一次性硬件投入的独立开发者

使用风险

依赖管理风险:技能依赖 python3pip3 及特定版本的 mlx-whisper 包,系统 Python 环境冲突或 MLX 框架更新可能导致功能失效。

存储与缓存占用:模型首次下载需约 465MB 流量与本地存储,多模型共存时缓存可达数 GB,长期运行需关注 ~/.cache/huggingface 目录膨胀。

超时与容错:默认 60 秒超时限制可能无法覆盖超长音频(如 1 小时以上会议录音),需手动调整配置;网络异常仅影响首次模型下载,但无优雅降级方案。

维护可持续性:作为社区驱动技能,后续兼容性依赖 OpenClaw 与 mlx-whisper 上游项目的同步更新,长期稳定性需持续验证。

mlx-whisper 内容

手动下载zip · 3.6 kB
package.jsonapplication/json
请选择文件