Ai Podcast Creation

🎙️ AI播客一站式生成,专业音色即刻上线

一站式AI播客创作工具链,集成Kokoro/DIA多音色TTS、AI配乐与音频合成,支持多角色对话、有声书及NotebookLM式文档转播客,适合内容创作者快速生成专业级音频。

收藏
8.3k
安装
2.3k
版本
0.1.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能

AI Podcast Creation 是一套基于 inference.sh CLI 的音频内容生产工具链,整合文本转语音(TTS)、AI 音乐生成与媒体合并三大能力,覆盖从脚本到成品的完整播客工作流。

文本转语音:支持 Kokoro TTS(11种高品质音色,含英美男女声)、DIA TTS(自然对话风格)及 Chatterbox(表现力型),可精细控制语速、停顿与情感色彩,满足新闻、有声书、娱乐等场景。

AI 音乐生成:通过 infsh/ai-music 生成片头片尾、背景氛围及转场音效,支持长度与风格定制,默认建议背景音乐音量控制在10-15%以避免干扰人声。

媒体合成infsh/media-merger 实现多轨音频拼接、交叉淡化(crossfade)、背景音叠加,支持从简单旁白到多角色对话的复杂编排。

显著优点

  • 音色丰富度高:Kokoro 提供细分场景化音色标签(如 am_michael 适合纪录片科技主题),大幅降低选声试错成本
  • 工作流闭环:从 Claude 脚本生成 → 分段 TTS → 音乐/音效 → 自动合并,单命令行即可完成整集制作
  • NotebookLM 替代方案:支持将文档内容转化为双主持人对话式播客,填补 Google NotebookLM 的地区限制与定制缺失
  • 专业音频控制:提供语速调节(0.9x 适合长章节)、交叉淡化毫秒级精度、背景音量百分比控制等广播级参数

局限与风险

  • 无可视化界面:纯 CLI 操作,对非技术用户门槛较高,需熟悉 JSON 参数与管道重定向
  • TTS 韵律局限:长文本易出现机械断句,需人工在脚本中插入标点优化;多音字与专业术语发音可能偏差
  • AI 音乐版权灰色地带:生成音乐的版权归属与平台合规性未明确,商业分发存在潜在风险
  • 依赖外部推理:所有 TTS 与音乐生成均调用云端 API,无离线能力,大规模生产需考虑成本与速率限制

适用人群

独立播客主、知识付费内容团队、有声书制作人、企业内训/ newsletter 音频化运营者,以及寻求 NotebookLM 替代方案的技术型内容创作者。

常规风险

  • 生成内容需人工审核,避免 AI 幻觉导致的错误信息传播
  • 建议保留原始脚本与工程文件,便于后期人工重录或调整
  • 商业项目应确认 inference.sh 服务条款与生成内容的授权范围

Ai Podcast Creation 内容

手动下载zip · 3.1 kB
SKILL.mdtext/markdown
请选择文件