Ai Podcast Pipeline

🎙️ 一键生成韩语AI播客完整资产

从趋势笔记自动生成韩语AI播客完整工作流:双主持脚本、Gemini多声部TTS、字幕同步渲染、缩略图及YouTube元数据一站式产出。

收藏
5k
安装
2k
版本
0.1.5
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心能力

AI Podcast Pipeline 是一套面向韩语AI播客生产的端到端自动化工作流,支持从QuickView趋势笔记生成完整播客资产包。系统采用双主持架构(Callie × Nick),通过Gemini多声部TTS实现自然对话音频,覆盖脚本撰写、音频合成、字幕生成、视频渲染、缩略图制作及YouTube元数据输出全链路。

显著优点

生产级可靠性设计:针对Gemini API超时问题实现智能分块构建(--chunk-lines 6),长脚本自动切分处理;支持双模式输出——完整版(15-20分钟)与压缩版(5-7分钟核心要点),适配不同分发场景。音频生成采用2026年2月固化的声线映射(Callie→Kore,Nick→Puck),确保品牌一致性。

精细化字幕控制:突破常规截断式字幕,采用完整文本呈现(无...省略),支持逐字级时间轴微调(--shift-ms -250滞后补偿),字体大小动态适配(25-27px防裁剪),专门针对韩语排版优化。

安全合规架构:API密钥严格环境变量隔离(GEMINI_API_KEY),近期加固已移除CLI参数传递;所有子进程调用(ffmpeg)与base64解码均限定于标准音视频处理流程,代码全开源可审计。

潜在局限

  • 供应商锁定:TTS与部分生成功能深度依赖Google Gemini API,存在服务可用性与定价变更风险
  • 语言单一性:当前优化聚焦于韩语播客,多语言扩展需额外开发
  • 人工审核缺口:缩略图风格、YouTube标题选项仍需人工最终确认,未实现全自动发布
  • Telegram传输限制:资产包体积需人工控制在即时通讯平台的 practical limits 内

适合人群

  • 运营韩语AI/科技趋势频道的创作者与工作室
  • 需要批量生产结构化音频内容的MCP(模型上下文协议)用户
  • 追求「笔记→成品」最小人工介入效率的技术向播客团队

常规风险

| 风险类型 | 说明 |
|---------|------|
| 误报拦截 | base64解码、子进程调用可能触发杀毒软件误报(已声明无害) |
| API密钥泄露 | 需严格遵循环境变量注入,禁止硬编码或日志残留 |
| 字幕同步漂移 | 需根据实际音频手动调整`shift-ms`参数 |
| 版权合规 | 生成内容需人工审核背景音乐、字体商用授权 |

Ai Podcast Pipeline 内容

references文件夹
scripts文件夹
手动下载zip · 20.9 kB
podcast_prompt_template_ko.mdtext/markdown
请选择文件