核心能力
AI Podcast Pipeline 是一套面向韩语AI播客生产的端到端自动化工作流,支持从QuickView趋势笔记生成完整播客资产包。系统采用双主持架构(Callie × Nick),通过Gemini多声部TTS实现自然对话音频,覆盖脚本撰写、音频合成、字幕生成、视频渲染、缩略图制作及YouTube元数据输出全链路。
显著优点
生产级可靠性设计:针对Gemini API超时问题实现智能分块构建(--chunk-lines 6),长脚本自动切分处理;支持双模式输出——完整版(15-20分钟)与压缩版(5-7分钟核心要点),适配不同分发场景。音频生成采用2026年2月固化的声线映射(Callie→Kore,Nick→Puck),确保品牌一致性。
精细化字幕控制:突破常规截断式字幕,采用完整文本呈现(无...省略),支持逐字级时间轴微调(--shift-ms -250滞后补偿),字体大小动态适配(25-27px防裁剪),专门针对韩语排版优化。
安全合规架构:API密钥严格环境变量隔离(GEMINI_API_KEY),近期加固已移除CLI参数传递;所有子进程调用(ffmpeg)与base64解码均限定于标准音视频处理流程,代码全开源可审计。
潜在局限
- 供应商锁定:TTS与部分生成功能深度依赖Google Gemini API,存在服务可用性与定价变更风险
- 语言单一性:当前优化聚焦于韩语播客,多语言扩展需额外开发
- 人工审核缺口:缩略图风格、YouTube标题选项仍需人工最终确认,未实现全自动发布
- Telegram传输限制:资产包体积需人工控制在即时通讯平台的 practical limits 内
适合人群
- 运营韩语AI/科技趋势频道的创作者与工作室
- 需要批量生产结构化音频内容的MCP(模型上下文协议)用户
- 追求「笔记→成品」最小人工介入效率的技术向播客团队
常规风险
| 风险类型 | 说明 |
|---------|------|
| 误报拦截 | base64解码、子进程调用可能触发杀毒软件误报(已声明无害) |
| API密钥泄露 | 需严格遵循环境变量注入,禁止硬编码或日志残留 |
| 字幕同步漂移 | 需根据实际音频手动调整`shift-ms`参数 |
| 版权合规 | 生成内容需人工审核背景音乐、字体商用授权 |