Local Vosk STT

🎙️ 极速离线语音识别,隐私零泄露

基于 Vosk 的轻量级本地语音转文本,完全离线运行,无需云端 API,适合隐私敏感场景的语音消息和音频文件转录。

收藏
3.8k
安装
1.8k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Local Vosk STT 是一款基于 Vosk 引擎的本地语音识别技能,支持将语音消息、音频文件等转换为文本,全程离线运行无需联网。用户通过命令行调用脚本即可快速完成转录,支持英语(默认)及多语言模型切换。

主要功能

  • 完全离线识别:音频处理在本地完成,无需上传云端
  • 多格式支持:依托 ffmpeg 解码,支持 ogg、mp3、wav、m4a、webm、flac 等常见格式
  • 轻量快速:默认模型仅 40MB,处理速度达实时 10 倍以上
  • 命令行便捷操作./skills/local-vosk/scripts/transcribe audio.ogg [--lang en-us]

显著优点

1. 隐私安全:语音数据零上传,彻底解决云端 STT 的隐私泄露风险
2. 低资源占用:小模型适合边缘设备和低配置环境

3. 无网络依赖:离线环境、内网场景均可稳定运行

4. 开源生态:基于 Vosk 开源项目,模型可自由替换升级

潜在局限

  • 识别精度有限:小模型对复杂口音、专业术语、噪声环境识别准确率不及云端 API(如 Whisper API)
  • 语言覆盖:需手动下载对应语言模型,小语种支持依赖社区贡献
  • 无实时流式:当前实现为文件批量处理,非实时语音流识别
  • 硬件性能瓶颈:大模型或长音频处理时,低配设备可能出现延迟

适合人群

  • 隐私敏感用户(医疗、法律、金融语音处理)
  • 离线/内网环境工作者
  • 轻量自动化需求(个人笔记、播客转录)
  • 低配置设备用户

常规风险

  • 模型质量风险:小模型误识别可能导致关键信息错漏
  • 依赖管理:需自行维护 ffmpeg、Python 环境及模型文件
  • 无自动更新:安全补丁和模型迭代需手动跟进

Local Vosk STT 内容

手动下载zip · 926 B
SKILL.mdtext/markdown
请选择文件