Faster Whisper

🗣️ 本地 GPU 极速语音转文字专家

本地高精度语音转文本工具,基于 OpenAI Whisper 重实现,GPU 加速下可达 20 倍实时转录速度,支持多语言、字幕生成与说话人分离

收藏
26.2k
安装
6.4k
版本
1.3.0
CLS 安全性认证2026-06-24
点击查看完整报告 >

使用说明

核心用法

faster-whisper 是 OpenAI Whisper 的 CTranslate2 高性能重实现版本,提供命令行工具 ./scripts/transcribe 用于本地音频转录。基础用法极为简洁:./scripts/transcribe audio.mp3 即可完成转录,默认使用 distil-large-v3.5 模型并启用批量推理与语音活动检测(VAD)。

关键功能路径:

  • 字幕生成:添加 --format srt--format vtt 自动生成带时间轴的字幕文件,配合 --word-timestamps 实现词级精度
  • 说话人分离--diarize 调用 pyannote.audio 识别不同说话人,输出带 SPEAKER_1、SPEAKER_2 标签的转录文本
  • URL/YouTube 输入:直接传入链接,自动通过 yt-dlp 下载并转录
  • 批量处理:支持 glob 模式、目录输入及 --skip-existing 断点续传
  • 领域术语优化--initial-prompt 可注入专业词汇(如 "Kubernetes, gRPC")提升识别准确率

模型选择策略:默认 distil-large-v3.5 在速度与精度间达到最佳平衡(约 6.3 倍速,7.08% WER);追求极致精度选 large-v3;英语-only 场景可用 distil-medium.en 获得 6.8 倍速;资源受限环境可选 distil-small.en。

显著优点

1. 极致速度:GPU 加速下可达 20 倍实时(RTX 3070 上 10 分钟音频约 30 秒完成),比原始 Whisper 快 4-6 倍
2. 完全本地化:无 API 费用、无需联网(除首次下载模型),隐私敏感场景首选

3. 功能完整:原生支持 SRT/VTT 字幕、说话人分离、99+ 语言自动检测、批量处理

4. 资源高效:INT8 量化使内存占用降低约 50%,distil 系列模型在 <1% 精度损失下实现 6 倍加速

5. 生产级稳定:基于 C++ 后端 CTranslate2,非实验性项目,适合长期部署

潜在缺点与局限性

1. 平台限制:macOS 仅支持 CPU 推理(无 Metal/CUDA 加速),Apple Silicon 约 3-5 倍实时,Intel Mac 仅 1-2 倍;纯 CPU 环境(Linux/macOS)速度降至 0.3-1 倍实时,实用性大减
2. 实时性不足:不支持流式转录,需完整音频文件,无法用于实时会议字幕等场景

3. 说话人分离门槛:需额外运行 setup.sh --diarize、配置 HuggingFace token 并接受模型使用协议,增加 ~20-30 秒处理开销,且对显存要求更高

4. 依赖管理复杂:需 Python 3.10+、ffmpeg、可选 yt-dlp 和 CUDA 环境,WSL2 还需额外配置 NVIDIA 驱动

5. 短音频不经济:<10 秒的音频文件,本地加载模型开销可能超过云端 API 调用延迟

适合人群

  • 内容创作者:快速为视频播客生成字幕,批量处理素材库
  • 研究人员/记者:转录采访录音、学术讲座,需说话人区分时尤为实用
  • 企业合规团队:处理敏感会议录音,要求数据不出本地
  • 多语言工作者:需要 99+ 语言自动识别与统一处理管道
  • 已有 NVIDIA GPU 的用户:无法发挥硬件价值是最大浪费

常规风险

  • 隐私泄露风险:虽为本地处理,但 --diarize 功能需 HuggingFace token,模型下载阶段存在 telemetry 可能;首次使用需确认缓存目录权限
  • 模型偏见:Whisper 模型对口音、方言、技术术语存在已知识别偏差,关键场景建议人工校对
  • 资源耗尽:大型模型 + diarization 组合可能触发 OOM,建议监控显存并准备 --batch-size 降级方案
  • 依赖供应链:yt-dlp 因 YouTube 反爬策略频繁更新失效,需保持工具链维护
  • 输出误用:自动生成字幕的标点与断句可能不符合专业出版标准,需后期编辑

安全解读

核心用法

Faster Whisper 是 OpenAI Whisper 的高性能本地重实现,通过 CTranslate2 推理引擎实现 4-6 倍加速,GPU 加速下可达 ~20 倍实时转录速度。主要功能包括:

基础转录./scripts/transcribe audio.mp3 快速生成文本,默认使用 distil-large-v3.5 模型平衡速度与精度

字幕生成:支持 SRT/VTT 格式输出(--format srt/vtt),自动启用词级时间戳

说话人分离--diarize 参数识别不同说话人,基于 pyannote.audio(需额外安装)

URL/YouTube 输入:直接传入链接自动下载处理,依赖 yt-dlp

批处理:支持 glob 模式、目录输入、--skip-existing 断点续传

模型选择策略:默认 distil-large-v3.5(6.3倍速,7.08% WER);英语-only 可选 distil-medium.en(6.8倍速);极限精度用 large-v3

显著优点

  • 速度领先:CTranslate2 后端 + 蒸馏模型,相比原版 Whisper 6倍速提升
  • 本地离线:首次下载模型后完全离线运行,零 API 费用
  • 硬件友好:支持 CUDA GPU 加速、INT8 CPU 量化、多模型梯度适配不同硬件
  • 功能完整:字幕、分离、多语言(99+语言)、批量处理、置信度过滤一应俱全
  • 隐私安全:音频与转录结果仅本地处理,无云端上传

潜在局限

  • 实时流式不支持:专为文件转录设计,非流式场景需其他工具
  • macOS 无 GPU 加速:Apple Silicon 依赖 CPU,速度降至 3-5x 实时
  • 分离功能配置复杂:需 HuggingFace token 及模型协议接受,增加 20-30s 开销
  • 显存门槛:large-v3 模型需 ~2GB VRAM,低端 GPU 可能 OOM
  • 首冷启动延迟:首次运行需下载模型(large-v3 约 1.5GB)

适合人群

  • 内容创作者:快速生成视频字幕、播客文稿
  • 研究人员:批量处理访谈录音、会议转写
  • 隐私敏感用户:需本地处理医疗/法律/商业机密音频
  • 多语言团队:自动检测 99+ 语言,支持术语预注入
  • 资源受限场景:可选 tiny/distil-small 模型在边缘设备运行

常规风险

  • 依赖管理:需 Python 3.10+、ffmpeg、可选 yt-dlp/pyannote,环境配置可能挫败新手
  • URL 输入风险:自动下载外部内容需信任 yt-dlp 及来源网站
  • 模型缓存占用:~2GB 缓存空间需提前规划
  • 长音频内存压力:默认 batch-size=8,超长文件可能触发 OOM,需手动降级
  • 分离精度限制:pyannote 对重叠语音、短片段识别仍有局限

Faster Whisper 内容

scripts文件夹
手动下载zip · 16.4 kB
transcribe.pytext/plain
请选择文件