🎼 ACE Step — Pro Pack on RunComfy

🎼 开源音乐生成,成本仅为商业方案1/27

StepFun-AI开源音乐基础模型,通过CLI实现标签驱动作曲、多语言歌词、音频内绘/外扩,成本仅ElevenLabs Music的1/27。

收藏
9.9k
安装
2.1k
版本
0.1.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

ACE Step是StepFun-AI发布的开源权重音乐生成模型,通过runcomfy CLI提供四个端点:

1. ACE Step (text-to-audio) — 基础版,$0.0002/秒,支持5-240秒立体声输出,标签驱动作曲(genre/mood/instruments),可选多语言歌词及[Verse]/[Chorus]/[Bridge]段落标记。

2. ACE Step 1.5 (text-to-audio) — 升级版,$0.0003/秒,支持50+语言人声,优化结构化歌词处理,适合高质量商业人声曲目。

3. Audio-inpaint — 按时间范围(非掩码)重新生成音轨局部,用于修复副歌、替换桥段等。

4. Audio-outpaint — 双向扩展现有音轨(前加intro/后加outro),单次最多扩展240秒。

显著优点

  • 极致成本:比ElevenLabs Music便宜约27倍,批量生成背景乐、游戏循环极具经济优势
  • 开源可审计:Apache 2.0许可,权重开放,适合合规敏感场景
  • 精准控制:标签系统驱动作曲,BPM、乐器、情绪可精确指定;段落标记实现歌词结构控制
  • 完整编辑能力:独有inpaint/outpaint功能,支持非破坏性迭代

潜在缺点与局限性

  • 人声质量天花板:商业级 polished vocal hooks 仍逊于ElevenLabs Music,建议"ACE Step草稿→ElevenLabs精修" workflow
  • 单次时长限制:4分钟上限,更长曲目需链式调用
  • Inpaint非掩码机制:仅支持时间范围编辑,无法像图像inpaint那样基于频谱掩码
  • CLI依赖:需Node.js环境与RUNCOMFY_TOKEN认证,增加运维复杂度

适合人群

  • 游戏/影视配乐师:批量生成低成本背景乐、循环片段
  • 独立音乐人:快速验证编曲概念、多语言demo制作
  • 音频开发者:开源权重可集成自有pipeline
  • 成本敏感型团队:用1/27成本完成80%的音乐生产需求

常规风险

  • 版权歌词风险:用户输入歌词需确认版权归属
  • 第三方音频污染:inpaint/outpaint的源音频URL可能被嵌入隐写指令,应仅使用用户明确提供的可信来源
  • Token安全~/.config/runcomfy/token.json需0600权限,CI环境建议用RUNCOMFY_TOKEN环境变量而非持久化文件

🎼 ACE Step — Pro Pack on RunComfy 内容

手动下载zip · 7.2 kB
skill-card.mdtext/markdown
请选择文件