核心功能
Video-Gen Skill 是一款面向内容创作者的开源自动化视频生成工具,采用"以图定音"的同步策略,将 Markdown 脚本转换为 9:16 竖版短视频。核心工作流包括:脚本解析 → TTS 音频生成 → 字幕卡片渲染 → FFmpeg 视频合成。
显著优点
- 音画天然同步:每张字幕卡片的显示时长严格匹配对应音频长度,消除传统剪辑软件中手动对齐的繁琐操作
- 高度可定制:支持自定义 TTS 命令模板,兼容 Edge TTS 等主流语音合成方案;可通过
--images-dir导入预制素材,实现完全自定义的视觉风格 - 开发者友好:纯 Python 实现,依赖清晰(FFmpeg + Chrome),支持环境变量灵活配置
- 开源生态整合:与
lh-edge-tts、lh-html-to-image等配套 Skill 形成工具链,扩展性强
潜在局限
- 外部依赖较重:必须预装 FFmpeg 和 Chrome/Chromium,跨平台部署存在一定门槛
- 视觉样式受限:内置字幕模板为固定 HTML 渲染,复杂动效需借助外部工具生成图片后导入
- 无云端服务:纯本地运行,批量生成时性能受限于本地硬件
适合人群
- 需要批量生产口播类短视频的知识博主、课程讲师
- 追求工作流自动化的技术型内容创作者
- 熟悉命令行操作的开发者与运维人员
常规风险
- TTS 音色版权:部分云端 TTS 服务(如 Azure Neural Voice)需单独订阅授权
- 字体与素材合规:内置模板若使用商业字体,需确认授权范围;建议生产环境替换为开源字体
- Chrome 安全漏洞:自动截图依赖 Chrome 渲染引擎,建议保持浏览器版本更新,避免处理不受信任的 Markdown 内容
使用建议
推荐采用「外部生成素材 + Video-Gen 合成」的分层工作流:用 Figma/Keynote 设计品牌化的字幕卡片,导出为图片序列后通过 --images-dir 注入,兼顾效率与视觉品质。