mlx-whisper

🎙️ Apple Silicon 本地语音转文字引擎

基于苹果 MLX 框架的 Whisper 本地语音识别方案,无需 API 密钥,M 系列芯片上运行速度提升约 60 倍,实现完全离线的语音消息自动转录。

收藏
2.1k
安装
823
版本
1.0.3
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

mlx-whisper 是为 OpenClaw 设计的本地语音转文字技能,专为 Apple Silicon(M1/M2/M3/M4)Mac 优化。当用户通过 Telegram 或 WhatsApp 发送语音消息时,该技能自动将音频文件(.ogg.opus 格式)转录为文本,供 Agent 后续处理。整个过程无需调用任何云端 API,完全依赖本地计算。

安装流程包含三步:首先通过 pip3 install mlx-whisper 安装核心库;其次将包装脚本 mlx-whisper-transcribe.sh 部署至 Python 用户目录的 bin 文件夹;最后在 ~/.openclaw/openclaw.json 中配置 tools.media.audio 模块,指定 CLI 命令路径与超时参数。首次运行时会自动下载约 465MB 的 whisper-small-mlx 模型,后续完全离线运行。

配置支持灵活定制:可切换 tiny/small/medium/large-v3 四种模型规格,也可在 args 中追加语言代码(如 "zh""en")以跳过自动检测、加速转录。建议根据精度需求与存储空间权衡选择模型。

显著优点

1. 极致隐私:语音数据全程本地处理,不上传任何第三方服务器,适合对数据敏感的个人或企业场景。
2. 性能飞跃:基于苹果 MLX 机器学习框架深度优化,在 M 系列芯片上比标准 Whisper 快约 60 倍,1 分钟音频约 7 秒完成转录。

3. 零 API 成本:无需申请 OpenAI API Key 或按量付费,一次性配置后永久免费使用。

4. 即时可用:安装完成后完全离线运行,无网络环境亦可正常工作。

潜在缺点与局限性

1. 平台锁定:仅限 macOS Apple Silicon 设备,Intel Mac 及 Windows/Linux 用户无法使用。
2. 首次下载依赖:虽运行期离线,但初次需联网下载模型文件(75MB–3GB),对网络环境有临时要求。

3. 存储占用:默认 small 模型 465MB,若选用 large-v3 则达 3GB,对磁盘空间有限的设备构成压力。

4. 非音乐识别:Whisper 专为语音设计,无法转录纯音乐或含强烈背景噪音的音频。

5. 配置门槛:需用户熟悉命令行操作、Python 环境管理及 JSON 配置编辑,非技术用户上手成本较高。

适合的目标群体

  • 隐私敏感型用户:律师、医生、记者等需确保语音内容不外泄的专业人士。
  • Apple Silicon Mac 用户:已配备 M 系列芯片且希望充分利用 NPU/GPU 算力的开发者或效率工具爱好者。
  • OpenClaw 重度使用者:频繁通过 Telegram/WhatsApp 与 Agent 语音交互,希望降低延迟与成本的用户。
  • 离线场景需求者:经常在无网络环境(如飞机上、偏远地区)使用语音输入的用户。

使用风险

1. 模型下载失败:首次配置时若网络中断,可能导致模型不完整,需手动清理 ~/.cache/huggingface 后重试。
2. 超时风险:长音频(如 30 分钟以上)可能触发默认 60 秒超时,需在配置中适当调大 timeoutSeconds

3. Python 环境冲突:若系统存在多版本 Python 或虚拟环境,可能导致 mlx_whisper 模块导入失败,建议明确使用 python3pip3

4. 脚本权限问题:忘记执行 chmod +x 会导致 OpenClaw 调用失败,需确保包装脚本具备可执行权限。

5. 语言识别偏差:未指定语言时,自动检测可能误判小语种或口音浓重的录音,建议明确传入语言参数以提升准确率。

mlx-whisper 内容

bin文件夹
手动下载zip · 2.9 kB
mlx-whisper-transcribe.shtext/x-shellscript
请选择文件