核心用法
该 Skill 通过 RunComfy CLI 封装 OpenAI GPT Image 2 的 /edit 端点(即 ChatGPT Images 2.0 的图生图能力),支持本地调用云端模型完成专业级图像编辑。核心调用范式为 runcomfy run openai/gpt-image-2/edit,输入需包含编辑指令 prompt 与 1-10 张参考图片 URL,可选 size 参数控制输出比例。
关键用法遵循「先声明保持、后声明修改」的提示结构:以 "Keep [face/pose/brand/framing] unchanged" 开头锁定需保留的元素,再以具体指令描述变更。多图参考时按序号引用("image 1"、"image 2"),多语言文本编辑需直接引用目标字符并标注文字体系(如 "コーヒー" in bold Japanese kana)。
显著优点
1. 身份保持能力领先:在图生图模型中属第一梯队,面部、姿态、品牌标识的稳定性显著优于通用方案
2. 多语言嵌入式文本编辑:支持拉丁、假名、CJK、西里尔、阿拉伯等文字体系的精准替换与生成,对本地化广告素材制作极具价值
3. 布局精准度:响应具体空间指令(如 "top-right to bottom-center"),适合 CTA、标题位置调整
4. 多图参考支持:最多 10 张图片作为辅助线索,可实现跨图元素合成(人物来自图1、场景来自图2)
5. 比例自适应:size: "auto" 默认保持输入宽高比,避免不必要的裁切变形
潜在局限
- 批量一致性不足:单次最多处理 1 张主图,若需对 20+ SKU 保持身份一致性,应改用 Nano Banana Edit
- 复合指令漂移:单条 prompt 涵盖过多修改目标时,细节保持能力下降,建议拆分为多轮编辑
- 尺寸枚举限制:仅支持 1024×1024、1024×1536、1536×1024 及 auto,其他值触发 422 错误
- 肖像真实感:与 Nano Banana Pro 直接对比时,后者在照片级人像真实度上仍占优
- 网络依赖:所有图像 URL 需公网可访问,且由 RunComfy 服务端抓取,存在外部内容不可控风险
适合人群
- 跨境电商/出海品牌的设计师:需快速生成多语言版本广告素材
- 内容运营团队:需批量调整图文排版、替换标题与 CTA
- AI 工作流开发者:需在 ComfyUI 或本地脚本中集成 GPT Image 2 的编辑能力
- 对「改图不改人」有强需求的产品摄影场景
常规风险
1. API Token 安全:runcomfy login 写入 ~/.config/runcomfy/token.json(权限 0600),CI 环境建议改用 RUNCOMFY_TOKEN 环境变量
2. URL 内容风险:传入的图片 URL 由 RunComfy 服务端抓取,存在第三方图片注入攻击的理论可能
3. 隐私边界:编辑指令明文传输至 model-api.runcomfy.net,敏感内容应避免在 prompt 中暴露
4. 输出不可控:AI 编辑存在固有随机性,关键商用素材需人工复核