🎼 ACE Step — Pro Pack on RunComfy

🎼 开源音乐生成,成本仅为商业方案1/27

StepFun-AI开源音乐基础模型,通过CLI实现标签驱动作曲、多语言歌词、音频内绘/外扩,成本仅ElevenLabs Music的1/27。

收藏
9.9k
安装
2.1k
版本
0.1.0
CLS 安全性认证2026-08-04
点击查看完整报告 >

使用说明

核心用法

ACE Step是StepFun-AI发布的开源权重音乐生成模型,通过runcomfy CLI提供四个端点:

1. ACE Step (text-to-audio) — 基础版,$0.0002/秒,支持5-240秒立体声输出,标签驱动作曲(genre/mood/instruments),可选多语言歌词及[Verse]/[Chorus]/[Bridge]段落标记。

2. ACE Step 1.5 (text-to-audio) — 升级版,$0.0003/秒,支持50+语言人声,优化结构化歌词处理,适合高质量商业人声曲目。

3. Audio-inpaint — 按时间范围(非掩码)重新生成音轨局部,用于修复副歌、替换桥段等。

4. Audio-outpaint — 双向扩展现有音轨(前加intro/后加outro),单次最多扩展240秒。

显著优点

  • 极致成本:比ElevenLabs Music便宜约27倍,批量生成背景乐、游戏循环极具经济优势
  • 开源可审计:Apache 2.0许可,权重开放,适合合规敏感场景
  • 精准控制:标签系统驱动作曲,BPM、乐器、情绪可精确指定;段落标记实现歌词结构控制
  • 完整编辑能力:独有inpaint/outpaint功能,支持非破坏性迭代

潜在缺点与局限性

  • 人声质量天花板:商业级 polished vocal hooks 仍逊于ElevenLabs Music,建议"ACE Step草稿→ElevenLabs精修" workflow
  • 单次时长限制:4分钟上限,更长曲目需链式调用
  • Inpaint非掩码机制:仅支持时间范围编辑,无法像图像inpaint那样基于频谱掩码
  • CLI依赖:需Node.js环境与RUNCOMFY_TOKEN认证,增加运维复杂度

适合人群

  • 游戏/影视配乐师:批量生成低成本背景乐、循环片段
  • 独立音乐人:快速验证编曲概念、多语言demo制作
  • 音频开发者:开源权重可集成自有pipeline
  • 成本敏感型团队:用1/27成本完成80%的音乐生产需求

常规风险

  • 版权歌词风险:用户输入歌词需确认版权归属
  • 第三方音频污染:inpaint/outpaint的源音频URL可能被嵌入隐写指令,应仅使用用户明确提供的可信来源
  • Token安全~/.config/runcomfy/token.json需0600权限,CI环境建议用RUNCOMFY_TOKEN环境变量而非持久化文件

安全解读

核心用法

ACE Step — Pro Pack 是一个通过 RunComfy CLI 调用 StepFun-AI 开源音乐基础模型的文档型技能,提供四大核心功能:

1. 文本生成音乐(ACE Step / ACE Step 1.5):通过标签驱动作曲,支持指定流派、情绪、乐器、BPM等参数,可选填歌词并支持章节标记([Verse]/[Chorus]/[Bridge])。ACE Step 1.5 版本额外支持50+种语言的多语言演唱。

2. 音频修复(Audio Inpaint):基于时间范围重新生成音频片段,可替换曲目中的特定段落(如修复糟糕的副歌、替换桥段),支持相对起点/终点的锚定方式。

3. 音频扩展(Audio Outpaint):双向延伸现有音轨,可在原曲前后添加前奏、尾奏或完整扩展,单次最多生成4分钟立体声输出。

4. 成本优化策略:基础模型$0.0002/秒(约27倍于ElevenLabs Music的价格优势),1.5版本$0.0003/秒,支持从5秒到4分钟的灵活时长配置。

调用方式统一通过 runcomfy run 命令配合 JSON 输入参数,输出目录由 --output-dir 指定,全程无需编写代码。

显著优点

  • 极致性价比:基础版本每秒仅需0.0002美元,批量生成背景音乐、游戏循环、广告配乐时成本优势显著
  • 开源模型保障:基于Apache 2.0协议的开放权重模型,无供应商锁定风险,可自建推理管线
  • 精细化控制能力:标签驱动作曲比纯文本提示更可控,章节标记支持结构化歌词编排
  • 非破坏性编辑:Inpaint/Outpaint功能突破传统"全曲重渲"模式,大幅降低迭代成本
  • 多语言支持:1.5版本覆盖50+语言,直接以目标语言撰写歌词即可获得对应语种演唱
  • 无缝工作流集成:CLI工具易于嵌入CI/CD、自动化脚本或批量处理管道

潜在缺点与局限性

  • 质量天花板:相比ElevenLabs Music等商业方案,ACE Step在高端人声质感、复杂编曲层次上存在差距,不适合追求极致商业 polished 效果的主打单曲
  • 时长硬限制:单次调用上限4分钟,更长曲目需链式调用增加复杂度
  • 依赖外部CLI:必须预先安装配置 @runcomfy/cli 并获取API Token,增加初期部署成本
  • 修复粒度局限:Inpaint基于时间范围而非频谱掩膜,无法实现"只换人声不换伴奏"等精细操作
  • 网络稳定性要求:音频文件URL需保持可访问,大文件传输失败需重试
  • 歌词版权风险:用户需自行确保提交歌词的版权合法性

适合的目标群体

  • 独立游戏开发者:需要大量低成本背景音乐、环境音效循环
  • 内容创作者:YouTube/TikTok视频配乐、播客片头片尾批量生成
  • 广告与营销团队:快速产出多版本广告配乐进行A/B测试
  • 音乐制作人:低成本草稿阶段快速验证风格方向,再决定是否投入高价方案精修
  • 教育与研究:AI音乐生成教学、多语言语音合成研究
  • 初创企业:预算有限但需要定制化品牌声音标识

使用风险

  • 第三方服务依赖:RunComfy平台的可用性、定价策略变更直接影响技能功能,建议关注官方公告
  • API Token泄露风险:Token存储于 ~/.config/runcomfy/token.json,多用户共享环境需严格权限控制,CI场景建议使用 RUNCOMFY_TOKEN 环境变量而非文件存储
  • 输入音频安全风险:Inpaint/Outpaint功能的源音频URL可能包含恶意内容,应仅使用用户明确提供的可信来源
  • 成本失控风险:批量生成长音频时费用累积迅速,建议设置预算上限、使用固定seed避免重复计费、迭代阶段优先使用短时长
  • 版权与合规:生成音乐的商业使用权限需遵循RunComfy服务条款,多语言内容需注意文化敏感性审查
  • CLI版本兼容性:技能文档基于特定CLI版本编写,升级后参数格式可能变化,建议锁定版本或充分测试

🎼 ACE Step — Pro Pack on RunComfy 内容

手动下载zip · 7.2 kB
skill-card.mdtext/markdown
请选择文件