🫧 GPT Image Edit — Pro Pack on RunComfy

🫧 GPT Image 2 专业图编,多语精准可控

基于 RunComfy 调用 GPT Image 2 /edit 端点,擅长多语言图文编辑、身份保持与精准布局调整,内置最佳提示词模式。

收藏
13.5k
安装
3.5k
版本
0.1.4
CLS 安全性认证2026-07-13
点击查看完整报告 >

使用说明

核心用法

该 Skill 通过 RunComfy CLI 封装 OpenAI GPT Image 2 的 /edit 端点(即 ChatGPT Images 2.0 的图生图能力),支持本地调用云端模型完成专业级图像编辑。核心调用范式为 runcomfy run openai/gpt-image-2/edit,输入需包含编辑指令 prompt 与 1-10 张参考图片 URL,可选 size 参数控制输出比例。

关键用法遵循「先声明保持、后声明修改」的提示结构:以 "Keep [face/pose/brand/framing] unchanged" 开头锁定需保留的元素,再以具体指令描述变更。多图参考时按序号引用("image 1"、"image 2"),多语言文本编辑需直接引用目标字符并标注文字体系(如 "コーヒー" in bold Japanese kana)。

显著优点

1. 身份保持能力领先:在图生图模型中属第一梯队,面部、姿态、品牌标识的稳定性显著优于通用方案
2. 多语言嵌入式文本编辑:支持拉丁、假名、CJK、西里尔、阿拉伯等文字体系的精准替换与生成,对本地化广告素材制作极具价值

3. 布局精准度:响应具体空间指令(如 "top-right to bottom-center"),适合 CTA、标题位置调整

4. 多图参考支持:最多 10 张图片作为辅助线索,可实现跨图元素合成(人物来自图1、场景来自图2)

5. 比例自适应size: "auto" 默认保持输入宽高比,避免不必要的裁切变形

潜在局限

  • 批量一致性不足:单次最多处理 1 张主图,若需对 20+ SKU 保持身份一致性,应改用 Nano Banana Edit
  • 复合指令漂移:单条 prompt 涵盖过多修改目标时,细节保持能力下降,建议拆分为多轮编辑
  • 尺寸枚举限制:仅支持 1024×1024、1024×1536、1536×1024 及 auto,其他值触发 422 错误
  • 肖像真实感:与 Nano Banana Pro 直接对比时,后者在照片级人像真实度上仍占优
  • 网络依赖:所有图像 URL 需公网可访问,且由 RunComfy 服务端抓取,存在外部内容不可控风险

适合人群

  • 跨境电商/出海品牌的设计师:需快速生成多语言版本广告素材
  • 内容运营团队:需批量调整图文排版、替换标题与 CTA
  • AI 工作流开发者:需在 ComfyUI 或本地脚本中集成 GPT Image 2 的编辑能力
  • 对「改图不改人」有强需求的产品摄影场景

常规风险

1. API Token 安全runcomfy login 写入 ~/.config/runcomfy/token.json(权限 0600),CI 环境建议改用 RUNCOMFY_TOKEN 环境变量
2. URL 内容风险:传入的图片 URL 由 RunComfy 服务端抓取,存在第三方图片注入攻击的理论可能

3. 隐私边界:编辑指令明文传输至 model-api.runcomfy.net,敏感内容应避免在 prompt 中暴露

4. 输出不可控:AI 编辑存在固有随机性,关键商用素材需人工复核

安全解读

核心用法

本 Skill 为纯文档型工具,通过本地 runcomfy CLI 将图像编辑请求转发至 RunComfy 托管的 OpenAI GPT Image 2 /edit 端点。核心调用方式为:

runcomfy run openai/gpt-image-2/edit \
  --input '{"prompt": "...", "images": ["https://..."]}' \
  --output-dir /path/to/output

支持多图参考(最多 10 张)尺寸自动保留size: auto)及三种固定比例。输入图像需提供公开可访问的 HTTPS URL。

提示词工程要点

必须前置保留指令:以 "Keep [face/pose/brand/layout] unchanged" 开头,再陈述修改目标。多语言文本编辑需直接引用目标字符并标注脚本类型,如 "reads \"コーヒー\" in bold Japanese kana"。空间操作使用具体方位词("top-right to bottom-center")。多图场景按编号引用("image 1", "image 2")。

---

显著优点

1. 多语言内嵌文本编辑业界领先:支持拉丁、假名、CJK、西里尔、阿拉伯等任意脚本的原位替换,排版精度高
2. 身份保持能力突出:人脸、姿态、品牌标识在定向编辑中稳定性强于同类模型

3. 多图参考架构:最多 10 张参考图,适合复杂合成(主体来自图1、场景来自图2、光照来自图3)

4. 布局精确控制:响应"移动标题从右上至底部居中"等空间指令

5. 尺寸智能保留auto 模式自动维持输入宽高比,避免意外裁切

---

潜在缺点与局限性

| 局限 | 说明 |
|------|------|

批量一致性弱 | 单次最多处理 1 张主图,20 张以上 SKU 批量编辑建议用 Nano Banana Edit |

| **复合指令漂移** | 长串多目标编辑("改A且改B且改C")易产生遗漏,建议拆分为多次调用 |
| **尺寸选项僵化** | 仅支持 `auto`、`1024_1024`、`1024_1536`、`1536_1024` 四种,自定义比例会 422 报错 |
| **人像真实感** | 极端 photorealism 场景下,Nano Banana Pro  head-to-head 更优 |
| **外部 URL 依赖** | 输入图像须为公开 HTTPS URL,无法直接读取本地路径(需自行托管) |
| **T3 来源** | 维护者为个人开发者 kalvinrv,非知名组织,长期维护存在不确定性 |

---

适合人群

  • 跨境电商运营:需快速生成多语言版本广告图,保持品牌视觉一致性
  • 设计师/创意工作者:需要精确替换海报文案、调整排版而不破坏整体构图
  • 内容本地化团队:处理含内嵌文字的图片翻译与脚本转换
  • AI 工作流搭建者:已将 RunComfy CLI 纳入自动化 pipeline 的技术用户

---

常规风险

1. 凭据泄露风险RUNCOMFY_TOKEN 若写入日志或环境变量快照可能被捕获;建议配合密钥管理工具使用
2. 图像 URL 投毒:输入的第三方图像 URL 可能被恶意替换为攻击载荷,建议仅使用可信 CDN

3. 生成内容合规:GPT Image 2 可能产生版权敏感或不当内容,商业发布前需人工审核

4. 服务可用性:依赖 RunComfy 第三方托管服务,存在单点故障与定价变动风险

5. 版本漂移:当前认证针对 v0.1.4,后续版本未经审计,升级需重新评估

🫧 GPT Image Edit — Pro Pack on RunComfy 内容

手动下载zip · 5.5 kB
skill-card.mdtext/markdown
请选择文件