Video Captions

🎬 AI 视频字幕生成与烧录工具

本地 AI 视频字幕生成工具,支持多引擎转录、逐词时间轴、专业样式预设与硬字幕烧录,全程离线保护隐私

收藏
7.2k
安装
1.5k
版本
1.0.1
CLS 安全性认证2026-07-13
点击查看完整报告 >

使用说明

核心用法

Video Captions 是一款专业的视频字幕生成技能,围绕 Whisper 本地转录引擎构建,提供从语音转文字到成品字幕的完整工作流。用户上传视频后,系统自动完成语音转录、时间轴对齐、格式转换与样式渲染,支持 SRT、VTT、TTML、ASS 等主流格式。

关键特性包括:

  • 多引擎转录:默认使用本地 Whisper(turbo 模型),可选 Apple Silicon 加速版(MLX Whisper)或逐词时间戳版(whisper-timestamped),云引擎(AssemblyAI、Deepgram)仅作为可选备选
  • 专业时间轴标准:内置 Netflix 合规规则(最少 0.83 秒、最多 7 秒、每行 42 字符、最多 2 行、字幕间隔 ≥2 帧),同时支持社交媒体短句分割风格
  • 智能分段规则:按标点、连词、介词断行,避免割裂语义单元(如冠词-名词、形容词-名词、姓名、主谓结构)
  • 逐词时间戳:支持卡拉 OK 式高亮、精准同步校验、TikTok/Instagram 动态字幕
  • 说话人识别:本地 diarization(pyannote)或云 API,输出 [Speaker 1][Name]: 格式
  • 样式与烧录:通过 ffmpeg 强制样式(FontName、Size、Color、Outline、Shadow、Alignment),支持 TikTok 居中粗体、Netflix 底部简洁等专业预设

显著优点

1. 隐私优先设计:默认 100% 离线处理,Whisper 本地运行,字幕文件与烧录视频均不离开本机,无需网络连接
2. 多平台适配:一键输出 YouTube(VTT)、Netflix(TTML)、社交媒体(ASS 烧录)、通用播放(SRT)等格式

3. 专业级质量控制:内置 Netflix timing rules、字符限制校验、同步点检查(起/中/尾)、烧录质量测试

4. 灵活工作流:从基础转录到翻译(--task translate)、多格式批量输出、VAD 预处理降噪,覆盖完整生产链路

5. 云引擎完全可选:AssemblyAI、Deepgram 仅在用户主动配置 API Key 并显式调用时才会触发,无默认外联

潜在缺点与局限性

  • 本地硬件依赖:Whisper large-v3 对 GPU/内存要求较高,低配设备转录长视频可能耗时较长
  • 复杂 diarization 精度:本地说话人分离在重叠语音、快速切换场景下准确率有限,专业级需求可能仍需人工校对
  • 样式烧录学习成本:ffmpeg force_style 参数语法(如 &HFFFFFF 颜色编码)对非技术用户不够直观
  • 语言检测偶发偏差:多语言混合内容可能出现误识别,需显式指定 --language
  • 长视频时间漂移:极端时长内容建议启用逐词时间戳并人工抽检同步

适合人群

  • 内容创作者(YouTube、TikTok、Instagram)需快速生成可上传或烧录字幕
  • 影视后期、流媒体制作人员需 Netflix/专业级合规字幕
  • 播客与访谈制作团队需说话人标注与 SDH(听障辅助)格式
  • 隐私敏感用户(企业培训、内部会议)需完全离线转录方案
  • 翻译与本地化工作者需原语转录+英译或外接翻译流程

常规风险

| 风险场景 | 缓解措施 |
|---------|---------|
| 静默幻觉(无声段出现虚假字幕) | 启用 VAD 预处理或修剪静音段落 |
| 语言识别错误 | 显式指定 `--language` 参数 |
| 长视频时间漂移 | 使用逐词时间戳 + 人工抽检关键同步点 |
| 字符超限导致平台拒收 | 设置 `--max_line_width 42` 并启用自动换行规则 |
| 烧录画质损失 | 指定高码率输出(`-b:v 8M`) |
| 云 API 误触发 | 不设置 `ASSEMBLYAI_API_KEY`/`DEEPGRAM_API_KEY` 即保持完全离线 |

安全解读

核心用法

Video Captions 是一款隐私优先的视频字幕生成 Skill,专为内容创作者、影视后期及多平台分发场景设计。其核心功能覆盖:多引擎转录(Whisper本地/MLX加速/云端可选)、词级时间戳、多格式输出(SRT/VTT/TTML/ASS)、样式预设与烧录嵌入。

典型工作流
1. 基础转录whisper video.mp4 --model turbo --output_format srt —— 自动语言检测,秒级生成

2. 社交媒体烧录:通过 FFmpeg 应用 ASS 样式(字体/描边/阴影/位置),直接嵌入视频

3. 专业合规:启用 Netflix 标准(42字符/行、7秒最大时长、2帧间隔),输出 TTML

4. 多说话人识别:本地 pyannote 声纹分离,自动标注 [Speaker 1] 或自定义人名

显著优点

  • 隐私安全:默认 100% 本地处理,音频数据永不外泄;AssemblyAI/Deepgram 云 API 仅当用户显式配置密钥后可选启用
  • 零依赖风险:纯 Markdown 文档 Skill,无代码执行,无第三方依赖声明
  • 平台全覆盖:从 YouTube 的 VTT 到 TikTok 的动态烧录字幕,一键适配
  • 专业级精度:支持 whisper-timestamped 的 DTW 词级对齐,消除长视频时间漂移

潜在局限

  • 依赖用户本地预装 ffmpegwhisper,环境配置门槛存在
  • T3 来源(个人开发者),长期维护稳定性需观察
  • 云 API 虽可选,但首次配置缺乏二次确认弹窗(建议改进)
  • 未声明开源许可证,商用场景需自行确认合规

适合人群:独立视频创作者、播客制作人、小型影视工作室、对隐私敏感的企业内训团队,以及需要批量生成多语言字幕的内容出海运营者。

常规风险

  • Whisper 长视频可能出现幻觉(hallucination),建议配合 VAD 预处理或分段处理
  • 烧录字幕时若 FFmpeg 参数不当,可能导致画质损失,需控制输出码率(建议 -b:v 8M
  • 多语言混合内容需显式指定 --language,避免自动检测偏差

Video Captions 内容

手动下载zip · 11.0 kB
engines.mdtext/markdown
请选择文件