Dub YouTube with Voice.ai

🎙️ 一键生成专业 YouTube AI 配音

基于 Voice.ai TTS 的 YouTube 视频配音工具,一键生成带章节标记、字幕和替换音轨的专业级 AI 配音,支持长视频与 Shorts。

收藏
4.6k
安装
2.2k
版本
0.1.5
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

本技能是一款面向 YouTube 创作者的专业 AI 配音工具,基于 Voice.ai 的 TTS(文本转语音)技术,将脚本转化为可直接发布的完整配音作品。核心工作流程为单命令执行:build 命令读取 Markdown 或纯文本脚本,按章节(## 标题)或自动分句拆分为语音片段,调用 Voice.ai API 逐段渲染,最终输出 stitched 主音频、章节时间戳、SRT 字幕、YouTube 描述模板及交互式审阅页面。

支持视频配音(--mux 模式),通过 ffmpeg 将生成的配音叠加到现有视频,提供 shortest/pad/trim 三种同步策略。内置智能缓存机制:基于文本内容、音色 ID 和语言的哈希值,未变更片段跳过渲染,实现快速迭代。多语言支持涵盖 11 种语言(en/es/fr/de/it/pt/pl/ru/nl/sv/ca),自动切换多语言 TTS 模型。

显著优点

  • 一站式出版流程:从脚本到 YouTube 发布所需的全套资产(音频、字幕、章节、描述)一键生成
  • 创作者友好的音色库:预置 9 款优化别名(如 oliver 适合教程、lilith 适合 ASMR),涵盖游戏、纪录片、生活方式等场景
  • 高效迭代:智能缓存避免重复渲染;--force 支持全局重渲;--mock 支持离线流程测试
  • 隐私保护:视频处理完全本地,仅脚本文本发送至 Voice.ai API
  • 无依赖部署:单文件 Node.js 脚本(≥20),无需 npm install,可选 ffmpeg 扩展音视频处理能力

潜在缺点与局限性

  • 外部 API 依赖:核心 TTS 功能完全依赖 Voice.ai 服务,存在服务中断、价格变动、地区可用性等风险
  • 成本模型:按 API 调用计费,长脚本或大频道需持续投入;信用不足(402)会直接中断工作流
  • ffmpeg 可选但关键:无 ffmpeg 时无法完成音频拼接、视频配音和响度标准化,输出仅为分散片段
  • 平台锁定:章节格式、描述模板针对 YouTube 优化,迁移至其他平台需手动调整
  • 音色克隆限制:不支持用户自定义音色上传,仅能用平台提供的预设音色

适合人群

  • 独立 YouTube 创作者:需要稳定输出、不愿投资录音设备的个人频道运营者
  • 教育/知识类频道:课程、教程、解说类内容的批量生产
  • 多语言运营团队:需快速生成多语言版本以拓展国际受众的 MCN 或品牌频道
  • Shorts 创作者:利用自动分句和快速渲染能力,适配短视频快节奏生产

常规风险

  • API 速率限制(429):顺序渲染设计已缓解,但高峰时段仍可能触发限流
  • 信用不足导致中断:需监控 Voice.ai 账户余额,建议设置预算预警
  • ffmpeg 路径或编码问题:Windows 路径含空格需引号包裹;非标准视频编码可能导致 mux 失败
  • 内容合规风险:AI 生成音频需符合 YouTube 的 AI 内容披露政策,建议在描述中标注

Dub YouTube with Voice.ai 内容

examples文件夹
references文件夹
templates文件夹
手动下载zip · 52.2 kB
shorts_script.txttext/plain
请选择文件