Ai Podcast Pipeline

🎙️ 一键生成完整播客资产包

从QuickView趋势笔记自动生成完整韩语播客包,含双主持脚本、Gemini多说话人TTS音频、字幕同步渲染及YouTube元数据输出,支持15-20分钟完整版与5-7分钟精编版

收藏
8.4k
安装
2k
版本
0.1.4
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能

AI Podcast Pipeline 是一套端到端的韩语AI播客内容生产工作流,专为技术趋势分析场景设计。系统从 Quartz 知识库的 QuickView 趋势笔记出发,通过标准化7步流程生成完整的播客资产包。

双主持角色设定:Callie(女声,Kore)与 Nick(男声,Puck)以对话形式呈现内容,增强听觉亲和力。脚本生成遵循韩语口语化原则——短句结构、可执行建议、避免元叙述,仅在开场保留一次性主持人介绍。

音频生成采用 Gemini Multi-Speaker TTS,针对长文本超时问题提供分块构建方案(--chunk-lines 6),默认120秒超时与3次重试机制保障稳定性。输出为双声道MP3,支持全文本韩语字幕(禁用省略号截断),字幕渲染阶段可调节字体(推荐"Do Hyeon")、字号(25-27pt)及时间偏移(通常-150至-300ms修正延迟)。

交付物完整性:最终包包含源文件引用、MP3路径、字幕MP4(含文件大小)、缩略图、3组YouTube标题备选及完整描述文案。系统内置 Telegram 文件体积实用限制检查。

显著优势

  • 全自动化链路:从 Markdown 源到可上传资产零手动剪辑
  • 韩语原生优化:TTS语音、字幕断行(22字符/行)、字体选择均针对韩语排版
  • 双模式弹性:完整版(15-20分钟)适合深度听众,压缩版(5-7分钟)适配通勤场景
  • 可靠性设计:分块构建、重试机制、超时参数可调,降低长内容生成失败率

局限与风险

  • 硬依赖 Gemini API:服务可用性与定价变动直接影响产能;无本地TTS fallback
  • 语音锁定:仅支持 Kore/Puck 两种预设音色,无法自定义声线或情感强度
  • 字幕同步非完美--shift-ms 需人工试调,复杂语速场景可能出现漂移
  • 缩略图生成未详述:Gemini 图像能力未在文档中说明,实际质量存疑

适用人群

韩语技术内容创作者、AI趋势分析师、希望以播客形式复用现有 QuickView/Quartz 笔记的知识管理者。尤其适合已有稳定 Gemini API 配额、追求高频产出的团队。

安全评估

密钥管理已通过审计:API key 强制通过环境变量 GEMINI_API_KEY 注入,CLI参数与日志中禁止明文出现。但用户仍需自行保障本地 .env 或 shell 历史的安全,避免截图泄露。

Ai Podcast Pipeline 内容

references文件夹
scripts文件夹
手动下载zip · 19.2 kB
podcast_prompt_template_ko.mdtext/markdown
请选择文件