核心用法
mlx-stt是一款专为Apple Silicon Mac设计的本地语音识别工具,利用Apple的MLX机器学习框架运行GLM-ASR模型。用户只需执行uv run mlx-stt.py <音频文件路径>即可将音频转换为文字,结果直接输出至终端。
显著优点
1. 完全本地化:所有推理在本地完成,无需上传音频至云端,隐私性极强
2. Apple Silicon深度优化:基于MLX框架,充分利用M系列芯片的神经网络引擎
3. 零成本使用:开源免费,无API调用费用或订阅限制
4. GLM-ASR模型:采用智谱AI的ASR模型,中文识别准确率较高
5. 自动化依赖管理:安装脚本自动通过Homebrew配置ffmpeg、uv等依赖
潜在缺点与局限性
- 平台锁定:仅限macOS+Apple Silicon,Intel Mac和Windows/Linux无法使用
- 模型体积:首次运行需下载大语言模型,占用存储空间
- 硬件门槛:需要较新的M系列芯片才能保证流畅体验
- 功能单一:仅支持语音转文字,无实时字幕、说话人分离等高级功能
适合人群
- 注重隐私的Mac用户(记者、律师、医疗工作者)
- 需要批量处理音频的播客/视频创作者
- 中文语音识别需求较高的用户
- 无法稳定连接网络的环境
常规风险
- 存储敏感:转录结果可能留在终端历史或日志中
- 模型来源:需从第三方下载GLM-ASR模型,存在供应链风险
- 依赖链复杂:涉及Python uv、brew、ffmpeg多层依赖,任一环节故障影响使用