MLX STT

🦞 Apple Silicon 本地免费语音转文字

Apple Silicon 本地语音转文字工具,基于 MLX 框架运行 GLM-ASR-Nano 模型,无需 API 密钥,完全离线免费。

收藏
9.7k
安装
3.7k
版本
1.0.5
CLS 安全性认证2026-07-06
点击查看完整报告 >

使用说明

核心用法

mlx-stt 是一款专为 Apple Silicon Mac 设计的本地语音转文字(STT/ASR)工具。用户通过 uv run mlx-stt.py <音频文件> 即可执行转录,首次运行会自动从 Hugging Face 下载约 2.5GB 的量化模型(mlx-community/GLM-ASR-Nano-2512-8bit)。底层依赖 MLX 框架利用 Apple Silicon 的 Neural Engine 加速推理,支持常见音频格式(需 ffmpeg 预处理)。

显著优点

1. 完全离线:无需网络连接或 API 密钥,隐私性强
2. 零成本:无按量计费,无订阅费用

3. Apple Silicon 优化:MLX 框架原生支持 M1/M2/M3/M4 系列芯片,推理效率高

4. 模型量化:8bit 量化版本平衡精度与显存占用

潜在缺点与局限性

1. 已弃用:官方明确标记为 deprecated,不再维护,推荐迁移至 mlx-audio-server
2. 硬件锁定:仅限 macOS + Apple Silicon,不支持 Intel Mac 或其他平台

3. 模型固定:当前仅支持 GLM-ASR-Nano-2512 系列,无法灵活切换其他 ASR 模型

4. 功能单一:纯命令行工具,无实时流式转录、无说话人分离、无时间戳

5. 首次下载:2.5GB 模型初次下载耗时且需 Hugging Face 访问

适合人群

  • Apple Silicon Mac 用户,重视隐私且不愿使用云端 ASR 服务
  • 开发者需批量离线转录音频文件的场景
  • 对延迟不敏感、接受命令行操作的技术用户

常规风险

  • 弃用风险:不再接收更新,未来 macOS/MLX 版本可能不兼容
  • 模型来源:依赖 Hugging Face 社区维护的量化模型,非官方渠道
  • 依赖管理:自动通过 brew 安装系统级工具,存在权限和路径冲突可能

安全解读

核心用法

mlx-stt 是一款基于 Apple MLX 框架的本地语音识别工具,专为 Apple Silicon 设备(MacBook、Mac mini 等)设计。核心工作流程为:

1. 环境准备:通过 brew 自动安装 ffmpeg(音频格式转换)、uv(Python 包管理)及 mlx_audio 核心库
2. 模型下载:首次运行自动从 Hugging Face 下载 mlx-community/GLM-ASR-Nano-2512-8bit 模型(约 2.5GB)

3. 语音识别:执行 uv run mlx-stt.py <音频文件路径> 完成转录,结果输出至 stdout

技术架构:基于清华大学 GLM-ASR-Nano-2512 模型,8-bit 量化优化,MLX 框架原生支持 Apple Silicon 的 Neural Engine 加速。

---

显著优点

| 维度 | 特性 |
|------|------|
| **隐私安全** | 纯本地运行,音频数据不上传云端,符合 GDPR 数据最小化原则 |
| **成本优势** | 零 API 费用,无订阅门槛,无限次本地调用 |
| **硬件适配** | MLX 框架深度优化 Apple Silicon,推理效率高于通用 PyTorch 方案 |
| **开箱即用** | 自动依赖安装脚本,降低环境配置门槛 |

---

潜在缺点与局限性

1. 项目状态:⚠️ 已标记为废弃(deprecated),官方明确推荐迁移至 mlx-audio-server,未来无更新保障
2. 平台锁定:仅限 macOS + Apple Silicon,Intel Mac 及其他系统无法运行

3. 存储开销:首装需下载 2.5GB 模型文件,对存储敏感用户不友好

4. 功能边界:仅支持单文件命令行转录,无实时流式识别、无说话人分离、无时间戳对齐

5. 维护风险:个人开发者维护(T3 级别),无企业 SLA 支撑

---

适合人群

  • 隐私敏感用户:医疗、法律、金融等场景需本地处理录音
  • Apple Silicon 设备持有者:追求端侧 AI 效率的 MacBook/Mac mini 用户
  • 开发者/极客:需快速搭建离线 ASR 原型,接受命令行交互
  • 成本受限场景:初创团队或个人开发者规避云服务订阅费用

不适合:需实时字幕、多语言支持(当前仅验证中文/英文)、跨平台部署或企业级稳定性的生产环境。

---

常规风险

| 风险项 | 等级 | 说明 |
|--------|------|------|
| 废弃维护风险 | ⚠️ 中 | 官方已停止更新,长期兼容性存疑 |
| 供应链依赖 | ⚠️ 低-中 | 依赖 `mlx-audio`、`ffmpeg` 等外部工具,版本漂移可能影响稳定性 |
| 输入验证不足 | ⚠️ 低 | 当前实现未严格校验音频文件格式,异常文件可能导致处理失败 |
| 模型来源 | ✅ 可控 | Hugging Face 官方社区模型,无已知篡改风险 |

使用建议:短期尝鲜或隐私优先场景可用,但需规划向 mlx-audio-server 的迁移路径;生产环境建议评估商业 ASR 方案。

MLX STT 内容

手动下载zip · 2.8 kB
install.shtext/x-shellscript
请选择文件