macos-local-voice

🎙️ 完全离线的 macOS 本地语音助手

基于 Apple 原生框架的完全离线语音处理方案,无需 API 密钥,本地完成高质量 STT/TTS,保障隐私数据零上传。

收藏
4.2k
安装
1.2k
版本
v1.0.0
CLS 安全性认证2026-05-15
点击查看完整报告 >

使用说明

macOS Local Voice 是一款专为 macOS 用户设计的完全本地化的语音处理工具,集成语音识别(STT)与语音合成(TTS)功能,利用 Apple 原生的 Speech.framework 和 say 命令,无需联网即可实现高质量的语音交互。

核心用法:该 Skill 提供三个主要功能模块。语音转文字(STT)通过 yap CLI 调用 Apple 本地语音识别引擎,支持包括中文(zh_CN)、英语(en_US)、日语(ja_JP)在内的数十种语言,可处理 ogg、m4a、mp3、wav 等多种音频格式。文字转语音(TTS)则利用系统内置的 say 命令,结合 ffmpeg 进行音频格式转换,支持输出高质量的 ogg/opus 格式音频文件,适用于即时通讯平台的发送。此外,语音管理模块允许用户查询、检测和自动选择最优语音,支持 Compact、Enhanced、Premium 三种质量等级。

显著优点:最大的优势在于完全离线处理,所有语音数据均在本地完成转换,无需上传至云端,从根本上保障了用户隐私安全。其次,零配置成本,无需申请 API 密钥或订阅第三方服务,安装依赖后即可无限次使用。得益于 Apple 原生的神经网络引擎优化,语音识别准确率和语音合成自然度均达到商用级别,特别是 Premium 级别的高质量语音(如 Yue、Ava)表现力接近真人。自动语言检测和智能语音选择功能进一步降低了使用门槛。

潜在缺点:该 Skill 存在明显的平台限制,仅支持 macOS 系统(Darwin),Windows 和 Linux 用户无法使用。功能上依赖外部命令行工具 yap,需要用户通过 Homebrew 额外安装,增加了初次配置的复杂度。Premium 质量语音虽然效果出色,但需要用户手动在系统设置中下载,且占用较大存储空间。此外,不支持 Siri 语音库,且缺乏实时流式识别能力,仅适合处理录音文件而非实时会议转录。

适合群体:主要面向注重隐私保护的 macOS 用户、需要离线语音功能的开发者、以及希望为 AI 助手添加语音交互能力的 OpenClaw/Claude Code 用户。特别适合处理敏感语音内容的场景,如医疗记录转录、法律文件整理等隐私要求严格的工作流。

使用风险:常规风险主要包括依赖项管理,若 yapffmpeg 未正确安装会导致功能异常。权限方面,首次使用麦克风时需授权系统权限,且 Skill 本身无法直接控制该权限申请。此外,say 命令在指定语音不可用时可能静默回退到默认语音,建议在关键场景下先使用 voices.mjs check 验证语音可用性。输出文件默认存储于 ~/.openclaw/media/outbound/,长期使用需注意磁盘空间管理。

安全解读

核心用法

macos-local-voice 是一套完全基于 macOS 原生能力的语音处理工具,提供离线语音识别(STT)与语音合成(TTS)功能。无需任何云端 API、无需网络连接、无需配置密钥,所有处理均在本地设备完成。

语音转文字 (STT)

调用 yap 工具(封装 Apple Speech.framework)实现设备端语音识别,支持 30+ 种语言/地区变体,包括中文(简体/繁体/香港)、英语(美式/英式)、日语、韩语等。自动检测或手动指定语言区域代码(如 zh_CNen_US),输出纯文本结果。

文字转语音 (TTS)

利用 macOS 内置 say 命令配合 AppleScript 调用系统语音合成引擎,支持三级音质(Compact/Enhanced/Premium)。Premium 语音(如「Yue」「Ava」)质量接近真人,需用户手动在系统设置中下载。自动根据文本语言选择最佳可用语音,也可强制指定特定声线。

输出格式与集成

若系统安装 ffmpeg,自动输出 Ogg/Opus 格式(适合即时通讯语音消息);否则输出 AIFF。生成的音频可直接通过消息工具作为语音消息发送。

显著优点

  • 零隐私风险:完全离线,音频数据不出设备,符合 GDPR 数据最小化原则
  • 零成本运行:无 API 调用费用,无订阅门槛
  • 音质优异:Premium 级别神经网络语音质量显著优于多数云端 TTS 免费档
  • 低延迟本地:无需网络往返,响应速度极快
  • 简洁依赖:零 npm 第三方依赖,仅使用 Node.js 内置模块

潜在局限

  • 平台锁定:仅限 macOS(Apple Silicon/Intel),无法跨平台使用
  • 语音准备成本:高质量 Premium 语音需用户手动下载(约 200-500MB/语种)
  • 功能边界:不支持 Siri 专属声线;语音识别准确率略低于云端方案(尤其专业术语)
  • 工具链依赖:需额外安装 yap(Homebrew)和可选的 ffmpeg

适合人群

  • 注重隐私、拒绝云端语音服务的 macOS 用户
  • 需要为自动化工作流(如 AI 助手、无障碍工具)添加低成本语音交互的开发者
  • 中文/多语种内容创作者,需要快速生成高质量语音草稿

常规风险

  • 需确保 yapffmpeg 等外部工具来源可信(Homebrew 官方渠道)
  • 输出目录默认位于 ~/.openclaw/media/outbound/,注意磁盘空间管理
  • Premium 语音首次使用需引导用户完成系统设置下载流程
  • 若未预装所需语音,系统静默回退至默认声线,可能不符合预期音质

macos-local-voice 内容

scripts文件夹
手动下载zip · 6.9 kB
stt.mjstext/javascript
请选择文件