MLX STT

🎙️ Apple Silicon专属离线语音识别

Apple Silicon专用离线语音识别工具,基于MLX框架和GLM-ASR模型,无需联网即可实现高质量语音转文字,完全免费

收藏
14.8k
安装
3.7k
版本
1.0.2
CLS 安全性认证2026-07-01
点击查看完整报告 >

使用说明

核心用法

mlx-stt是一款专为Apple Silicon Mac设计的本地语音识别工具,利用Apple的MLX机器学习框架运行GLM-ASR模型。用户只需执行uv run mlx-stt.py <音频文件路径>即可将音频转换为文字,结果直接输出至终端。

显著优点

1. 完全本地化:所有推理在本地完成,无需上传音频至云端,隐私性极强
2. Apple Silicon深度优化:基于MLX框架,充分利用M系列芯片的神经网络引擎

3. 零成本使用:开源免费,无API调用费用或订阅限制

4. GLM-ASR模型:采用智谱AI的ASR模型,中文识别准确率较高

5. 自动化依赖管理:安装脚本自动通过Homebrew配置ffmpeg、uv等依赖

潜在缺点与局限性

  • 平台锁定:仅限macOS+Apple Silicon,Intel Mac和Windows/Linux无法使用
  • 模型体积:首次运行需下载大语言模型,占用存储空间
  • 硬件门槛:需要较新的M系列芯片才能保证流畅体验
  • 功能单一:仅支持语音转文字,无实时字幕、说话人分离等高级功能

适合人群

  • 注重隐私的Mac用户(记者、律师、医疗工作者)
  • 需要批量处理音频的播客/视频创作者
  • 中文语音识别需求较高的用户
  • 无法稳定连接网络的环境

常规风险

  • 存储敏感:转录结果可能留在终端历史或日志中
  • 模型来源:需从第三方下载GLM-ASR模型,存在供应链风险
  • 依赖链复杂:涉及Python uv、brew、ffmpeg多层依赖,任一环节故障影响使用

安全解读

核心用法

mlx-stt 是一款专为 Apple Silicon Mac 设计的本地语音转文字工具,利用 Apple 的 MLX 深度学习框架运行 GLM-ASR 模型,完全离线完成转录任务。用户通过 uv run mlx-stt.py <音频文件路径> 即可调用,脚本自动处理音频格式转换(借助 ffmpeg)并输出纯文本结果到 stdout。

显著优点

1. 完全本地运行:所有计算在设备端完成,音频数据不上传云端,隐私性极强
2. 零 API 成本:无需订阅第三方 STT 服务(如 OpenAI Whisper API),长期使用零费用

3. Apple Silicon 优化:基于 MLX 框架深度利用 GPU/Neural Engine,转录速度快且能耗低

4. 依赖管理规范:使用 uvbrew 管理依赖,来源可追溯,无 typosquatting 风险

5. 代码结构清晰:功能单一专注,122 行代码实现完整流程,易于审计

潜在缺点与局限性

1. 平台限制:仅支持 macOS + Apple Silicon,Intel Mac 及 Linux/Windows 无法使用
2. 模型依赖:需下载 GLM-ASR 模型,首次使用有带宽和存储开销

3. 无实时流式支持:仅支持文件级批处理,不适合实时会议转录场景

4. 外部依赖较多:依赖 ffmpeg、uv、brew 等工具,环境配置有一定门槛

5. T3 来源风险:个人开发者维护,长期维护稳定性不及 T1/T2 级别项目

适合人群

  • 隐私敏感用户:律师、医生、记者等需处理敏感录音的专业人士
  • Apple Silicon 用户:已拥有 M 系列芯片 Mac 且希望充分利用本地算力
  • 成本敏感用户:需要大量转录任务但不愿支付 API 费用
  • 技术爱好者:愿意接受一定配置门槛以换取可控性和透明度

常规风险

  • 输入路径需确保为可信来源的音频文件,避免路径遍历攻击(当前代码已通过 Path.expanduser() 缓解)
  • 依赖 mlx-audio 较新项目(2025年),需关注安全更新
  • 错误输出被重定向到 DEVNULL,调试时可能难以排查问题

MLX STT 内容

手动下载zip · 2.5 kB
install.shtext/x-shellscript
请选择文件