🎨 AI Image Generation — Pro Pack on RunComfy

🎨 11+ 模型一键生成,智能路由最优画质

RunComfy 官方 AI 图像生成工具,聚合 FLUX、GPT Image、Seedream 等 11+ 模型,一句话命令完成文生图/图生图,自动匹配最优模型与提示词模式。

收藏
11.4k
安装
3.2k
版本
0.1.0
CLS 安全性认证2026-07-13
点击查看完整报告 >

使用说明

核心用法

ai-image-generation-runcomfy 是 RunComfy 官方提供的 CLI 驱动型 AI 图像生成技能,通过单一认证即可调用 11+ 主流图像模型。支持 文生图 (t2i)图生图/编辑 (i2i) 双模式,系统根据用户意图自动路由至最优模型:

| 场景 | 推荐模型 | 核心优势 |
|:---|:---|:---|
| 通用/快速迭代 | FLUX 2 Klein 9B/4B | 步数蒸馏 4-25 步,4 张参考图风格迁移 |
| 精准文字排版 | GPT Image 2 | 日/韩/阿语等多语言内嵌文字,布局精确控制 |
| 超高速草稿 | Nano Banana 2 | 亚秒级响应,支持 Web 搜索 grounding |
| 真实感人像/产品 | Seedream 5 Lite | 肤色自然、东亚美学、光影 cinematic |
| 开源权重工作流 | Qwen Image 2512 / Wan 2-7 | LoRA 兼容,可本地部署 |

调用方式

runcomfy run <vendor>/<model>/<endpoint> \
  --input '{"prompt": "..."}' --output-dir ./out

显著优点

  • 智能路由:无需手动选模型,技能解析意图自动匹配 FLUX/GPT Image/Seedream 等最佳后端
  • 统一 CLI 接口:单点登录 (runcomfy login) 覆盖全模型目录,JSON Schema 与文档一一对应
  • 生产级参数透传:步数、分辨率、参考图、Web 搜索、安全等级等模型原生能力完整暴露
  • 跨品牌一致性:同品牌 t2i→i2i 配对使用(如 Seedream 5 Lite 生成后同模型编辑),身份保持连贯

潜在缺点与局限性

  • 依赖 RunComfy 云服务:需有效 RUNCOMFY_TOKEN,无法完全离线运行
  • 模型特有约束:GPT Image 2 仅 3 种固定尺寸;FLUX 4B 质量略降于 9B;开源模型 (Wan/Qwen) 与闭源模型存在质量鸿沟
  • 成本阶梯明显:Nano Banana 2 的 4K 输出约为 0.5K 草稿的 16× 成本
  • 编辑能力边界:复杂蒙版修复、批量编辑需转用独立 image-edit 技能

适合人群

  • 设计师/创意团队:需快速迭代多风格概念、保持品牌视觉一致性
  • 开发者/自动化工作流:通过 CLI 将图像生成集成至 CI/CD、批处理脚本
  • 本地化需求用户:依赖 GPT Image 2 的多语言精准排版,或 Seedream 的东亚审美
  • 开源偏好者:Qwen Image、Wan 2-7 提供可本地部署的 LoRA 兼容方案

常规风险

  • Token 安全:凭证存储于 ~/.config/runcomfy/token.json (0600 权限),CI 环境建议改用 RUNCOMFY_TOKEN 环境变量
  • 间接提示注入:参考图 URL 与 enable_web_search 结果为不可信输入,可能携带隐藏指令
  • 成本失控:高分辨率 (4K)、多图批量 (num_images: 4)、Web 搜索叠加会快速累积费用
  • 内容安全:各模型 safety_tolerance 等级 1-6 可调,需根据使用场景主动配置

安全等级:S

官方 CLI 工具、HTTPS 传输、Token 文件权限控制、无任意代码执行面;主要风险在于第三方引用图/搜索结果可能携带对抗性内容。

安全解读

核心用法

AI Image Generation — Pro Pack on RunComfy 是一个模型智能路由型技能,覆盖 RunComfy 平台完整的图像生成模型目录。用户通过自然语言描述意图(如"生成海报"、"编辑这张人像"),技能自动匹配最优模型并输出对应的 runcomfy run CLI 命令。

两大核心模式

| 模式 | 典型场景 | 推荐模型 |
|:---|:---|:---|
| **文生图 (t2i)** | 创意概念、品牌海报、产品摄影、插画 | FLUX 2 Klein 9B(默认)、GPT Image 2(排版)、Seedream 5(人像)、Nano Banana 2(快速迭代) |
| **图生图/编辑 (i2i)** | 背景替换、风格迁移、多语言文案改写、局部精修 | Nano Banana 2 Edit(默认)、GPT Image 2 Edit(多语言)、FLUX Kontext Pro(单点精确编辑) |

调用示例

# 文生图 - FLUX 2 Klein 9B(默认)
runcomfy run blackforestlabs/flux-2-klein/9b/text-to-image \
  --input '{"prompt": "紫猫坐在苔藓石上,金色逆光,浅景深,照片级真实", "steps": 25}'

# 排版精准 - GPT Image 2(支持中日韩阿拉伯等多语言文字)
runcomfy run openai/gpt-image-2/text-to-image \
  --input '{"prompt": "海报标题精确显示\"AURORA 2026\",白色无衬线字体,深蓝背景", "size": "1536_1024"}'

# 图生图 - Nano Banana 2 Edit(身份保持)
runcomfy run google/nano-banana-2/edit \
  --input '{"prompt": "保持人物身份姿态不变,背景替换为赛博朋克霓虹街道", "image_urls": ["https://.../portrait.jpg"]}'

模型选择策略

技能内置智能决策树,根据用户意图自动路由:

  • 意图不明/通用场景 → FLUX 2 Klein 9B(4-25步可调,支持1-4张参考图)
  • 需要精确文字排版 → GPT Image 2(海报、广告、多语言创意)
  • 人像摄影/自然肤色 → Seedream 5 Lite(字节跳动,东亚美学优化)
  • 极速迭代/草图批量 → FLUX 2 Klein 4B(亚秒级)或 Nano Banana 2
  • 开源/LoRA 工作流 → Qwen Image 2512、Wan 2-7、Z-Image Turbo

---

显著优点

1. 一站式多模型聚合

覆盖 BlackForestLabs、OpenAI、Google、ByteDance、Alibaba 等顶级厂商的 11+ 模型,无需分别注册多个平台,单一 Token 统管全部。

2. 智能意图路由

自动识别"排版"、"人像"、"速度"、"开源工作流"等需求维度,避免用户陷入"选模型"决策疲劳。

3. 专业级排版能力

GPT Image 2 支持日语假名、西里尔字母、阿拉伯语等复杂文字系统的精确渲染,是少数能处理多语言图文混排的商业级方案。

4. 身份保持编辑

Nano Banana 2 Edit 支持 1-20 张输入图,默认保持人物身份,理解"左上角物体"等空间语言,适合电商批量变体、广告本地化。

5. 开放性与可扩展性

  • 支持 LoRA 微调模型(Qwen、Z-Image 的 /lora 端点)
  • 完整 API Schema 文档化,每个模型页面可查 JSON 字段
  • CLI 管道友好,输出目录可配置,适合自动化工作流

6. 安全设计周全

  • 输入经 JSON 封装,无 shell 注入风险
  • Token 文件 0600 权限,支持环境变量覆盖
  • 明确披露第三方图片 URL 的间接提示注入风险

---

潜在缺点与局限性

1. 网络依赖与成本

  • 完全依赖 RunComfy 云服务,无离线能力
  • 按调用计费,4K 分辨率成本约为 0.5K 的 16 倍,批量生产需精细控制 resolution 参数
  • 企业内网需放行 model-api.runcomfy.net*.runcomfy.com

2. 模型能力边界

  • FLUX 系列:文字渲染弱于 GPT Image 2,复杂排版需切换模型
  • GPT Image 2:仅支持三种固定尺寸(1024²、1024×1536、1536×1024),无法自定义
  • Seedream:东亚人像优化强,但欧美肖像、深肤色表现可能不如 FLUX
  • 开源模型(Qwen/Wan):质量略低于闭源旗舰,需自行调优

3. 编辑功能分割

完整编辑能力(蒙版驱动修复、智能扩图)被拆分到独立的 image-edit 技能,本技能仅覆盖基础 i2i,重度编辑需组合使用。

4. 参考图安全风险

enable_web_search 和外部图片 URL 可能引入对抗性内容或版权争议素材,需用户自行审核来源。

---

适合人群

| 用户类型 | 典型场景 |
|:---|:---|
| **品牌/广告设计师** | 多语言海报批量生成、A/B 测试创意变体 |
| **电商运营** | 产品图背景替换、模特换装、季节主题迭代 |
| **游戏/影视概念美术** | 快速 moodboard、角色草图、风格探索 |
| **AI 工作流开发者** | 通过 CLI 集成 CI/CD、自动化批量生成管道 |
| **多语言内容团队** | 同一布局生成中英日韩阿语版本,保持视觉一致 |
| **开源 AI 研究者** | 对比 FLUX、Qwen、Wan 等同参数规模模型表现 |

---

常规风险

合规与版权

  • 生成内容可能近似受版权保护的风格或特定人物形象,商业使用需审查 RunComfy 服务条款及本地法规
  • enable_web_search 可能抓取受版权保护的参考图,存在衍生风险

Token 安全

  • 泄露 RUNCOMFY_TOKEN 可导致账户盗用与 API 滥用
  • 共享环境(云服务器、容器)需改用环境变量注入而非文件存储

内容安全

  • 模型内置安全过滤器(Nano Banana 的 safety_tolerance 1-6 级),但边缘案例仍可能漏过
  • 用户提供的参考图若含隐写指令(steganography),可能间接影响生成结果

供应商锁定

  • 深度依赖 RunComfy 平台,模型更新、定价调整、服务条款变更均影响使用
  • 开源模型虽可本地部署,但本技能设计为云端调用,迁移成本存在

🎨 AI Image Generation — Pro Pack on RunComfy 内容

手动下载zip · 10.0 kB
skill-card.mdtext/markdown
请选择文件