核心用法
GPT Image Edit 是 OpenAI GPT Image 2 的 /edit 端点封装,通过 RunComfy CLI 调用 openai/gpt-image-2/edit 实现图像到图像编辑。核心输入为 prompt(编辑指令)和 images(最多10张公开 HTTPS 图片URL),可选 size 参数控制输出比例。
关键特性
| 能力 | 说明 |
|------|------|
| 多语言文字编辑 | 支持拉丁、假名、CJK、西里尔、阿拉伯等任意脚本的原位改写 |
| 身份保持 | 面部、姿态、品牌标识的高保真保留 |
| 多图参考 | 最多10张图,支持「主体来自图1、场景来自图2」的构图指令 |
| 布局精准 | 响应「将标题从右上移至底部居中」等空间定向指令 |
标准调用流程
1. 安装 CLI:npm i -g @runcomfy/cli
2. 登录:runcomfy login(CI 环境用 RUNCOMFY_TOKEN)
3. 执行编辑,提示词遵循「先声明保留,再说明修改」结构
提示词最佳实践
"Keep the person's face, pose, and brand mark unchanged. Replace the background with soft warm-grey studio sweep."
多语言文字必须直引原字符并标注脚本类型,如 "コーヒー" in bold Japanese kana。
显著优点
- 同类最强身份保持:面部、姿态、服装在编辑中稳定性领先
- 多语言内嵌文字原生支持:无需外挂 OCR,直接按脚本类型生成目标文字
- 布局指令可落地:空间方位词(top-right, bottom-center)被实际执行
- 多图路由清晰:numbered reference 机制让复杂合成可控
局限性与替代方案
| 场景 | 局限 | 替代 |
|------|------|------|
| 批量 20+ 图一致性 | 单请求上限10图 | **Nano Banana Edit** |
| 极致局部精修、源保真优先 | 全局编辑倾向 | **Flux Kontext** |
| 高写实肖像 | 略逊于 Nano Banana Pro | **Nano Banana Pro** |
| 文生图 | 本 skill 为图生图 | **gpt-image-2 (t2i)** |
复合编辑建议拆分为多轮,避免「改A且改B且改C」导致漂移。
适合人群
- 跨境运营/本地化团队:需快速产出同一视觉资产的多语言版本
- 品牌设计师:需安全替换 CTA/标题而不破坏整体构图
- 电商视觉:模特保持不变,仅换背景或添加促销文字
- 合成创作者:需将不同来源的主体与场景可信融合
常规风险
- 提示词漂移:未明确声明「保留」时,模型可能隐性修改面部或品牌
- 文字引用错误:意译而非直引目标文字,导致输出不符
- size 参数越界:仅支持
auto/1024_1024/1024_1536/1536_1024,其他值报 422 - 网络依赖:需公开 HTTPS 图片 URL,私有存储需预签名
- Token 安全:
~/.config/runcomfy/token.json为敏感文件,需确保 0600 权限
安全与隐私
- 仅调用 RunComfy 官方 CLI,无外泄 telemetry
- 自动下载限制在
*.runcomfy.net/*.runcomfy.com域名 - 支持
Ctrl-C取消远程请求,避免资源浪费