Auto Video Editing

🎬 AI语音驱动,一键智能剪辑

基于AI语音识别的自动化视频剪辑工具,支持口播/脱口秀视频智能切分、字幕生成与多片段合成,大幅降低后期制作门槛。

收藏
7.1k
安装
1.5k
版本
1.2.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

video-editing 是一套完整的自动化视频后期工作流,专为口播、脱口秀、vlog 类内容创作者设计。其核心能力是将长视频按语音语义精确切分为独立句子片段,支持用户按需选择后自动合成带字幕的最终成片。

完整工作流程
1. 音频提取:从视频提取 WAV 格式音频

2. 语音识别:调用 Whisper(推荐 faster-whisper)生成带时间戳的逐句文本

3. 视频切分:按句子边界精确切割视频片段

4. 字幕烧录:为每个片段生成适配字幕(支持竖屏/横屏自动优化)

5. 交互选片:展示片段列表供用户跨视频选择

6. 合成导出:合并选中片段为最终视频

7. 封面生成:基于转录内容自动生成带标题的封面帧

8. 章节时间轴:添加可视化进度条,支持 YouTube 章节标记

9. 质量验证:检测片段衔接处是否有重复音频

显著优点

  • 智能自动化:从语音内容驱动剪辑决策,无需手动标记时间点
  • 多平台优化:自动检测 macOS(Apple Silicon/Intel)、Linux、WSL、Windows,调用硬件编码加速(VideoToolbox/NVENC/QSV/AMF)
  • 竖屏原生适配:针对小红书、抖音等 9:16 平台优化字幕位置和字体大小
  • 灵活选片:支持连续范围、多选、混合选择的片段组合方式
  • AI 辅助标题:可从转录文本自动生成观众视角的吸睛封面标题

潜在缺点与局限性

  • 依赖重量级模型:large-v3 模型需约 2.9GB 下载,首次使用准备时间较长
  • 中文识别门槛:base/small 模型中文准确率较低,对硬件有一定要求
  • 非创意剪辑:基于语音切分,无法自动识别画面内容或情感节奏,不适合需要复杂叙事结构的艺术创作
  • 前置依赖较多:需 ffmpeg、Python 环境及可能的 GPU 驱动配置

适合人群

  • 知识博主、口播创作者需要快速生产字幕版本
  • 播客/脱口秀后期团队处理多机位素材
  • 企业培训部门批量剪辑内部讲话视频
  • 短视频运营需快速迭代竖屏内容

常规风险

  • 语音识别错误可能导致切点偏移,建议在 Phase 2 后人工检查转录文本
  • 合成后可能出现技术性音频重复,需按 Phase 8 验证流程排查
  • 依赖外部服务(Google Fonts、HuggingFace)下载字体和模型,国内用户需关注网络稳定性

Auto Video Editing 内容

scripts文件夹
手动下载zip · 32.0 kB
add_chapter_bar.pytext/plain
请选择文件