Dub YouTube with Voice.ai

🎙️ 一键生成 YouTube 级专业 AI 配音

将脚本一键转换为带章节、字幕、音频替换的 YouTube 配音成品,支持长视频与 Shorts 的本地化 AI 语音制作。

收藏
5.7k
安装
2.2k
版本
0.1.0
CLS 安全性认证2026-07-14
点击查看完整报告 >

使用说明

核心用法

Dub YouTube with Voice.ai 是一个面向 YouTube 创作者的专业 AI 配音工作流工具,基于 Node.js 运行,通过 Voice.ai 的 TTS API 将文字脚本转化为可直接发布的完整配音方案。

主要功能

  • 一键生成完整配音:从 .md.txt 脚本输出带编号分段的 WAV 音频、拼接后的母带、YouTube 章节时间戳、SRT 字幕、预览页面及现成描述文案
  • 视频配音替换:通过 --video --mux 参数将生成的语音直接叠加到现有视频,支持最短对齐、填充静音或裁切三种同步策略
  • 智能缓存机制:基于文本内容+音色+语言的哈希缓存,修改仅影响变更片段,大幅提升迭代效率
  • 多语言支持:覆盖英、西、法、德、意、葡、波、俄、荷、瑞、加泰罗尼亚等 11 种语言
  • YouTube 专用模板:自动注入片头片尾,生成可直接粘贴到 YouTube 描述区的章节标记

显著优点

  • 零依赖快速部署:单文件 .cjs 直接运行,无需 npm install(Node.js 20+ 即可)
  • 本地化视频处理:视频流仅本地 ffmpeg 处理,不上传云端,保护原始素材隐私
  • 专业级输出规格:母带经过响度标准化,AAC 编码兼容 YouTube 要求,SRT 字幕可直接上传
  • 创作者友好设计:提供 review.html 交互页面逐段审听,支持 --mock 模式零成本测试完整流程

潜在局限与风险

  • 外部 API 依赖:核心 TTS 功能完全依赖 Voice.ai 商业服务,需付费 API 密钥,存在服务中断或价格变动风险
  • ffmpeg 为可选依赖:若无 ffmpeg,仅能生成分段 WAV 和元数据,无法自动拼接母带或视频混流
  • 音色选择受限:预设音色仅 9 种,扩展需通过 API 查询,且非自托管模型无法离线使用
  • 长文本分段限制:单段超过 490 字符会自动拆分,可能影响自然停顿控制
  • 平台锁定风险:输出格式高度针对 YouTube 优化,迁移至其他平台需手动调整

适合人群

  • 需要高频产出 YouTube 长视频/Shorts 的个人创作者与 MCN 机构
  • 制作多语言版本内容的国际化运营团队
  • 希望降低配音成本、提升迭代速度的教程/知识类频道
  • 已有现成视频素材、仅需替换旁白的屏幕录制或游戏解说创作者

常规风险

  • API 速率限制与额度:可能遇到 429 限流或 402 余额不足,需监控用量
  • 版权与肖像权:使用第三方训练音色(如 Corpse Husband、Master Chief 等)需确认 Voice.ai 的授权范围,避免侵权争议
  • AI 语音透明度:YouTube 平台对 AI 生成内容有披露政策要求,需主动标注
  • 缓存失效误操作--force 会强制重渲全部片段,可能意外消耗 API 额度

安全解读

核心用法

dub-youtube-with-voiceai 是一款面向 YouTube 创作者的 AI 配音自动化工具,核心功能是将文本脚本转换为可直接发布的完整视频素材。只需一条命令即可完成:语音合成 → 音频拼接 → 视频混音 → 章节生成 → 字幕导出全流程。

典型工作流

node voiceai-vo.cjs build \
  --input script.md \
  --voice oliver \
  --title "教程视频" \
  --video ./recording.mp4 --mux

输入支持 Markdown(按 ## 标题分段)或纯文本(按句子自动分句)。输出包含:master.wav 主音频、muxed.mp4 混音视频、chapters.txt 章节时间戳(可直接粘贴到 YouTube 描述)、captions.srt 字幕文件、review.html 分段审听页面。

显著优点

  • 一站式交付:传统工作流需要分别操作 TTS 工具、音频编辑软件、字幕生成器、视频剪辑软件,此工具全部集成
  • 智能缓存:基于文本+语音+语言哈希的缓存机制,修改单段仅重渲染该段,迭代效率极高
  • 多语言原生支持:内置 11 种语言支持(en/es/fr/de/it/pt/pl/ru/nl/sv/ca),自动切换多语言 TTS 模型
  • 本地隐私优先:视频处理完全本地执行,仅脚本文本发送至 Voice.ai API
  • YouTube 模板化--template youtube 自动注入频道片头片尾,标准化品牌输出

潜在缺点与局限性

  • 外部 API 依赖:核心 TTS 功能绑定 Voice.ai 商业服务,需持续付费且存在服务中断风险
  • ffmpeg 可选但关键:若无 ffmpeg,无法完成音频拼接和视频混音,仅能输出分段文件
  • 语音风格受限:依赖 Voice.ai 预设声线,无法自定义微调音色、语速、情感强度
  • 长文本自动切分:超过 490 字符的段落会被强制拆分,可能破坏语义连贯性
  • T3 来源风险:个人开发者维护项目,长期维护承诺存疑

适合人群

  • 批量制作教程/解说类视频的独立创作者
  • 需要多语言本地化配音的 MCN 机构
  • 追求「无麦克风录制」工作流程的屏幕录制博主
  • 需要快速迭代脚本、频繁调整内容的敏捷创作者

常规风险

  • API 密钥泄露:需妥善保管 VOICE_AI_API_KEY,建议使用 .env 文件而非环境变量全局设置
  • 额度消费失控:TTS 按字符计费,长脚本+多语言版本可能快速消耗 credits
  • 版权与肖像:使用「Corpse Husband」「Zhongli」等角色声线需注意平台内容政策风险
  • 音频质量上限:AI 语音的自然度、停顿节奏仍不及真人配音,对高情感表达内容可能生硬
  • 缓存失效陷阱:修改后若发现音频未更新,需手动 --force 清除缓存

技术架构

纯 Node.js 单文件设计(voiceai-vo.cjs),零 npm install 依赖,仅 3 个生产依赖(chalk、commander、dotenv)。代码经 CLS-Certify v2.1.0 扫描,静态分析 90 分,无危险函数调用,输入验证完善。

| 指标 | 结果 |
|------|------|
| 静态代码分析 | 90/100 ✅ |
| 动态行为分析 | 85/100 ✅ |
| 依赖审计 | 95/100 ✅ |
| 网络流量分析 | 80/100 ✅(仅 HTTPS 访问 dev.voice.ai)|
| 隐私合规检查 | 85/100 ✅ |

Dub YouTube with Voice.ai 内容

examples文件夹
references文件夹
src文件夹
commands文件夹
templates文件夹
手动下载zip · 83.8 kB
shorts_script.txttext/plain
请选择文件