Video Captions

🎬 AI 离线转录·专业字幕·一键烧录

100%离线AI语音识别引擎,支持多格式字幕生成、词级时间戳、专业级样式烧录,满足影视制作到社交媒体全场景需求

收藏
5k
安装
1.5k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Video Captions 是一款专业级视频字幕处理技能,围绕 OpenAI Whisper 本地引擎构建完整工作流:

1. 转录引擎 — 默认使用 Whisper turbo 本地模型,100%离线运行;Apple Silicon 设备自动启用 MLX 加速;可选 whisper-timestamped 实现词级时间戳对齐。

2. 格式生态 — 覆盖全平台标准:SRT(通用)、VTT(YouTube)、TTML(Netflix/专业影视)、ASS(高级样式/烧录),支持一键格式互转。

3. 专业标准 — 内置 Netflix 合规模板(单行≤42字符、最长7秒、最少0.833秒、行间≥2帧间隙),以及社交媒体短句分段规则(2-4词高频切分、动态居中定位)。

4. 烧录样式 — 通过 FFmpeg 集成 ASS 强制样式,预置 TikTok/Instagram(粗体居中大字幕)与 Netflix(底部简洁风格)两种典型方案,支持自定义字体、描边、阴影参数。

5. 进阶功能 — 说话人分离(diarization,可选 pyannote 本地或云端)、SDH 无障碍字幕(音效标记)、实时翻译(--task translate)。

显著优点

  • 隐私优先:默认零网络传输,音频绝不外泄;云端 API(AssemblyAI、Deepgram)仅为文档化备选,需用户显式配置密钥方可启用
  • 专业级精度:词级时间戳支持卡拉OK式逐词高亮,DTW 对齐算法修正长视频漂移
  • 平台全覆盖:从 YouTube 创作者到 Netflix 交付规范,单工具链满足多元场景
  • 开源可控:依赖 FFmpeg、Whisper 等成熟开源组件,无商业授权壁垒

局限与风险

  • 硬件门槛:本地 Whisper 运行需 GPU 或 Apple Silicon 以获得实时性能;纯 CPU 环境长视频处理较慢
  • 幻觉问题:静音段可能产生伪文本,建议配合 VAD(语音活动检测)预处理
  • 混语言内容:自动语言检测可能失效,需手动指定 --language
  • 说话人分离精度:本地 diarization 准确率逊于云端方案,复杂场景建议人工校验

适合人群

| 场景 | 推荐配置 |
|------|---------|
| 自媒体/短视频创作者 | turbo + ASS 烧录 + 社交媒体样式 |
| 影视后期/翻译团队 | large-v3 + TTML + Netflix 合规检查 |
| 播客/访谈制作 | diarization + SDH 格式 |
| 隐私敏感企业/机构 | 纯本地工作流,禁用所有云 API |

常规风险

  • 转录错误:专业术语、口音、低音质音频需人工校对
  • 版权字体:烧录使用商业字体需确认授权
  • 存储路径:批量处理时注意输出文件覆盖风险
  • 长视频内存:极端时长视频建议分段处理避免 OOM

Video Captions 内容

手动下载zip · 11.0 kB
engines.mdtext/markdown
请选择文件