核心功能
AI Podcast Creation 是一套基于 inference.sh CLI 的音频内容生产工具链,整合文本转语音(TTS)、AI 音乐生成与媒体合并三大能力,覆盖从脚本到成品的完整播客工作流。
文本转语音:支持 Kokoro TTS(11种高品质音色,含英美男女声)、DIA TTS(自然对话风格)及 Chatterbox(表现力型),可精细控制语速、停顿与情感色彩,满足新闻、有声书、娱乐等场景。
AI 音乐生成:通过 infsh/ai-music 生成片头片尾、背景氛围及转场音效,支持长度与风格定制,默认建议背景音乐音量控制在10-15%以避免干扰人声。
媒体合成:infsh/media-merger 实现多轨音频拼接、交叉淡化(crossfade)、背景音叠加,支持从简单旁白到多角色对话的复杂编排。
显著优点
- 音色丰富度高:Kokoro 提供细分场景化音色标签(如
am_michael适合纪录片科技主题),大幅降低选声试错成本 - 工作流闭环:从 Claude 脚本生成 → 分段 TTS → 音乐/音效 → 自动合并,单命令行即可完成整集制作
- NotebookLM 替代方案:支持将文档内容转化为双主持人对话式播客,填补 Google NotebookLM 的地区限制与定制缺失
- 专业音频控制:提供语速调节(0.9x 适合长章节)、交叉淡化毫秒级精度、背景音量百分比控制等广播级参数
局限与风险
- 无可视化界面:纯 CLI 操作,对非技术用户门槛较高,需熟悉 JSON 参数与管道重定向
- TTS 韵律局限:长文本易出现机械断句,需人工在脚本中插入标点优化;多音字与专业术语发音可能偏差
- AI 音乐版权灰色地带:生成音乐的版权归属与平台合规性未明确,商业分发存在潜在风险
- 依赖外部推理:所有 TTS 与音乐生成均调用云端 API,无离线能力,大规模生产需考虑成本与速率限制
适用人群
独立播客主、知识付费内容团队、有声书制作人、企业内训/ newsletter 音频化运营者,以及寻求 NotebookLM 替代方案的技术型内容创作者。
常规风险
- 生成内容需人工审核,避免 AI 幻觉导致的错误信息传播
- 建议保留原始脚本与工程文件,便于后期人工重录或调整
- 商业项目应确认 inference.sh 服务条款与生成内容的授权范围