核心用法
Video Captions 是一款专业的视频字幕生成技能,围绕 Whisper 本地转录引擎构建,提供从语音转文字到成品字幕的完整工作流。用户上传视频后,系统自动完成语音转录、时间轴对齐、格式转换与样式渲染,支持 SRT、VTT、TTML、ASS 等主流格式。
关键特性包括:
- 多引擎转录:默认使用本地 Whisper(turbo 模型),可选 Apple Silicon 加速版(MLX Whisper)或逐词时间戳版(whisper-timestamped),云引擎(AssemblyAI、Deepgram)仅作为可选备选
- 专业时间轴标准:内置 Netflix 合规规则(最少 0.83 秒、最多 7 秒、每行 42 字符、最多 2 行、字幕间隔 ≥2 帧),同时支持社交媒体短句分割风格
- 智能分段规则:按标点、连词、介词断行,避免割裂语义单元(如冠词-名词、形容词-名词、姓名、主谓结构)
- 逐词时间戳:支持卡拉 OK 式高亮、精准同步校验、TikTok/Instagram 动态字幕
- 说话人识别:本地 diarization(pyannote)或云 API,输出
[Speaker 1]或[Name]:格式 - 样式与烧录:通过 ffmpeg 强制样式(FontName、Size、Color、Outline、Shadow、Alignment),支持 TikTok 居中粗体、Netflix 底部简洁等专业预设
显著优点
1. 隐私优先设计:默认 100% 离线处理,Whisper 本地运行,字幕文件与烧录视频均不离开本机,无需网络连接
2. 多平台适配:一键输出 YouTube(VTT)、Netflix(TTML)、社交媒体(ASS 烧录)、通用播放(SRT)等格式
3. 专业级质量控制:内置 Netflix timing rules、字符限制校验、同步点检查(起/中/尾)、烧录质量测试
4. 灵活工作流:从基础转录到翻译(--task translate)、多格式批量输出、VAD 预处理降噪,覆盖完整生产链路
5. 云引擎完全可选:AssemblyAI、Deepgram 仅在用户主动配置 API Key 并显式调用时才会触发,无默认外联
潜在缺点与局限性
- 本地硬件依赖:Whisper large-v3 对 GPU/内存要求较高,低配设备转录长视频可能耗时较长
- 复杂 diarization 精度:本地说话人分离在重叠语音、快速切换场景下准确率有限,专业级需求可能仍需人工校对
- 样式烧录学习成本:ffmpeg
force_style参数语法(如&HFFFFFF颜色编码)对非技术用户不够直观 - 语言检测偶发偏差:多语言混合内容可能出现误识别,需显式指定
--language - 长视频时间漂移:极端时长内容建议启用逐词时间戳并人工抽检同步
适合人群
- 内容创作者(YouTube、TikTok、Instagram)需快速生成可上传或烧录字幕
- 影视后期、流媒体制作人员需 Netflix/专业级合规字幕
- 播客与访谈制作团队需说话人标注与 SDH(听障辅助)格式
- 隐私敏感用户(企业培训、内部会议)需完全离线转录方案
- 翻译与本地化工作者需原语转录+英译或外接翻译流程
常规风险
| 风险场景 | 缓解措施 |
|---------|---------|
| 静默幻觉(无声段出现虚假字幕) | 启用 VAD 预处理或修剪静音段落 |
| 语言识别错误 | 显式指定 `--language` 参数 |
| 长视频时间漂移 | 使用逐词时间戳 + 人工抽检关键同步点 |
| 字符超限导致平台拒收 | 设置 `--max_line_width 42` 并启用自动换行规则 |
| 烧录画质损失 | 指定高码率输出(`-b:v 8M`) |
| 云 API 误触发 | 不设置 `ASSEMBLYAI_API_KEY`/`DEEPGRAM_API_KEY` 即保持完全离线 |