核心用法
本 Skill 是 RunComfy 视频生成模型的智能路由层,通过本地 CLI 统一调度 10+ 行业顶尖视频模型。支持三大生成模式:
文本生成视频 (T2V):默认调用 HappyHorse 1.0(Artificial Analysis Video Arena #1),原生 1080p 同步音频生成;可选 Wan 2-7 实现特定语音对口型,或 Seedance v2 Pro 进行多模态 cinematic 创作(支持 9 图/3 视频/3 音频参考)。
图像生成视频 (I2V):HappyHorse 1.0 I2V 为默认,擅长人物动效与音频描述;Veo 3-1 主打物理精确运动与物体恒常性;Kling 3.0 提供 4K 多镜头角色一致性。
视频延长:Veo 3-1 Extend 支持运动/光照/身份连贯的片段续作。
调用范式标准化为 runcomfy run <vendor>/<model>/<endpoint> --input '{...}',Skill 自动匹配用户意图(质量优先/速度优先/成本敏感/特定功能如 lip-sync)至最优模型。
显著优点
- 模型覆盖全面:集成 Arena 榜首 HappyHorse、Google Veo 3-1、Kling 3.0 4K、ByteDance Seedance v2/Dreamina、MiniMax Hailuo、Wan 2-7 等全量商业级模型,避免多平台账号碎片化。
- 意图智能路由:内置决策树自动选择模型——需原生音频选 HappyHorse,需物理精确旋转选 Veo,需 4K 角色叙事选 Kling 3.0,需语音对口型选 Wan 2-7,大幅降低模型选择认知负担。
- 统一 CLI 工作流:单条命令完成鉴权、提交、轮询、下载,输出目录可控,支持 CI/CD 集成。
- 提示词工程内置:每模型附带经 RunComfy 验证的 prompting 模式(如 Seedance 的 lens language、Veo 的 "no other motion" 约束),降低试错成本。
- 原生音频能力:HappyHorse 1.0 与 Seedance v2 支持 in-pass 音频生成,省去独立 Foley 制作步骤。
潜在缺点与局限性
- 成本分层显著:Kling 3.0 4K、Seedance v2 Pro 等顶级模型单位成本较高,需显式降级至 Pro/Standard/Fast 档位控制预算。
- 音频对口型局限:Wan 2-7 虽支持 audio_url 驱动唇同步,但需用户自备语音文件,无法像 HappyHorse 那样自动生成匹配音频。
- 物理 vs. 美学权衡:Veo 3-1 物理精确但艺术表现力弱于 Seedance;Seedance cinematic 风格强但计算开销大,无免费档位。
- 视频延长依赖同源:Extend 功能目前仅限 Veo 3-1 生态,其他模型(如 Kling、HappyHorse)尚不支持跨模型延长。
- CLI 依赖 Node/npm:需全局安装
@runcomfy/cli,Windows/Linux/macOS 环境需预配置 Node 运行时。
适合人群
- 创意广告与社媒运营:需快速产出 9:16/16:9 多比例短视频,带原生音频,迭代频繁。
- 影视预演与概念设计:利用 Seedance v2 多模态参考与 Kling 多镜头一致性,快速验证分镜。
- 电商与产品可视化:Veo 3-1 的物理精确旋转、物体恒常性适合产品 360° 展示。
- AI 工作流集成者:通过标准化 JSON 输入与 CLI 退出码,嵌入自动化管线(如批量生成、A/B 测试)。
- 技术型创作者:熟悉命令行,愿以代码化方式控制视频生成参数(seed、aspect_ratio、camera language)。
常规风险
- Token 安全:
RUNCOMFY_TOKEN以 0600 权限写入~/.config/runcomfy/token.json,CI 场景需通过环境变量注入,禁止硬编码或日志输出。 - 间接提示注入:参考图/音频/视频 URL 内容可能被恶意嵌入指令(图像内文字、EXIF 元数据、音频水印),需确保素材来源可信或由用户显式提供。
- 生成内容合规:AI 视频可能产生虚假人物、不当场景或版权敏感元素,商用前需人工审核,遵守平台 AUP 与地区法规。
- 成本失控:4K 档位与多模态参考叠加可能产生高额费用,建议先用 Fast/Standard 档位验证提示词。
- 依赖服务可用性:RunComfy 为第三方托管平台,模型 API 变更、速率限制或区域性故障可能影响生成任务。