核心用法
Video Captions 是一款专业级视频字幕处理技能,围绕 OpenAI Whisper 本地引擎构建完整工作流:
1. 转录引擎 — 默认使用 Whisper turbo 本地模型,100%离线运行;Apple Silicon 设备自动启用 MLX 加速;可选 whisper-timestamped 实现词级时间戳对齐。
2. 格式生态 — 覆盖全平台标准:SRT(通用)、VTT(YouTube)、TTML(Netflix/专业影视)、ASS(高级样式/烧录),支持一键格式互转。
3. 专业标准 — 内置 Netflix 合规模板(单行≤42字符、最长7秒、最少0.833秒、行间≥2帧间隙),以及社交媒体短句分段规则(2-4词高频切分、动态居中定位)。
4. 烧录样式 — 通过 FFmpeg 集成 ASS 强制样式,预置 TikTok/Instagram(粗体居中大字幕)与 Netflix(底部简洁风格)两种典型方案,支持自定义字体、描边、阴影参数。
5. 进阶功能 — 说话人分离(diarization,可选 pyannote 本地或云端)、SDH 无障碍字幕(音效标记)、实时翻译(--task translate)。
显著优点
- 隐私优先:默认零网络传输,音频绝不外泄;云端 API(AssemblyAI、Deepgram)仅为文档化备选,需用户显式配置密钥方可启用
- 专业级精度:词级时间戳支持卡拉OK式逐词高亮,DTW 对齐算法修正长视频漂移
- 平台全覆盖:从 YouTube 创作者到 Netflix 交付规范,单工具链满足多元场景
- 开源可控:依赖 FFmpeg、Whisper 等成熟开源组件,无商业授权壁垒
局限与风险
- 硬件门槛:本地 Whisper 运行需 GPU 或 Apple Silicon 以获得实时性能;纯 CPU 环境长视频处理较慢
- 幻觉问题:静音段可能产生伪文本,建议配合 VAD(语音活动检测)预处理
- 混语言内容:自动语言检测可能失效,需手动指定
--language - 说话人分离精度:本地 diarization 准确率逊于云端方案,复杂场景建议人工校验
适合人群
| 场景 | 推荐配置 |
|------|---------|
| 自媒体/短视频创作者 | turbo + ASS 烧录 + 社交媒体样式 |
| 影视后期/翻译团队 | large-v3 + TTML + Netflix 合规检查 |
| 播客/访谈制作 | diarization + SDH 格式 |
| 隐私敏感企业/机构 | 纯本地工作流,禁用所有云 API |
常规风险
- 转录错误:专业术语、口音、低音质音频需人工校对
- 版权字体:烧录使用商业字体需确认授权
- 存储路径:批量处理时注意输出文件覆盖风险
- 长视频内存:极端时长视频建议分段处理避免 OOM