核心用法
ACE Step是StepFun-AI发布的开源权重音乐生成模型,通过runcomfy CLI提供四个端点:
1. ACE Step (text-to-audio) — 基础版,$0.0002/秒,支持5-240秒立体声输出,标签驱动作曲(genre/mood/instruments),可选多语言歌词及[Verse]/[Chorus]/[Bridge]段落标记。
2. ACE Step 1.5 (text-to-audio) — 升级版,$0.0003/秒,支持50+语言人声,优化结构化歌词处理,适合高质量商业人声曲目。
3. Audio-inpaint — 按时间范围(非掩码)重新生成音轨局部,用于修复副歌、替换桥段等。
4. Audio-outpaint — 双向扩展现有音轨(前加intro/后加outro),单次最多扩展240秒。
显著优点
- 极致成本:比ElevenLabs Music便宜约27倍,批量生成背景乐、游戏循环极具经济优势
- 开源可审计:Apache 2.0许可,权重开放,适合合规敏感场景
- 精准控制:标签系统驱动作曲,BPM、乐器、情绪可精确指定;段落标记实现歌词结构控制
- 完整编辑能力:独有inpaint/outpaint功能,支持非破坏性迭代
潜在缺点与局限性
- 人声质量天花板:商业级 polished vocal hooks 仍逊于ElevenLabs Music,建议"ACE Step草稿→ElevenLabs精修" workflow
- 单次时长限制:4分钟上限,更长曲目需链式调用
- Inpaint非掩码机制:仅支持时间范围编辑,无法像图像inpaint那样基于频谱掩码
- CLI依赖:需Node.js环境与
RUNCOMFY_TOKEN认证,增加运维复杂度
适合人群
- 游戏/影视配乐师:批量生成低成本背景乐、循环片段
- 独立音乐人:快速验证编曲概念、多语言demo制作
- 音频开发者:开源权重可集成自有pipeline
- 成本敏感型团队:用1/27成本完成80%的音乐生产需求
常规风险
- 版权歌词风险:用户输入歌词需确认版权归属
- 第三方音频污染:inpaint/outpaint的源音频URL可能被嵌入隐写指令,应仅使用用户明确提供的可信来源
- Token安全:
~/.config/runcomfy/token.json需0600权限,CI环境建议用RUNCOMFY_TOKEN环境变量而非持久化文件