核心功能与定位
baoyu-image-gen 是一款面向专业用户的多提供商 AI 图像生成 CLI 工具,支持 OpenAI GPT Image 2、Google Gemini、Azure OpenAI、阿里通义万象(DashScope)、Replicate、即梦、豆包等 12 家主流图像生成 API。其核心设计哲学是"统一接口、灵活路由"——用户通过同一套 CLI 参数即可调用不同提供商的模型,无需关心底层 API 差异。
关键特性
1. 多模态与身份保持
- 支持文本生图、参考图编辑、批量生成三种模式
- 独创"硬身份保持"提示词策略:避免长描述导致模型合成新人物,而是用简短指令强制复用参考图中的身份
- 参考图支持因提供商而异:Google、OpenAI、Azure、Replicate、MiniMax、Seedream、Agnes 等支持,Jimeng、Seedream 3.0 等不支持
2. 企业级批量生成
- 默认顺序执行,自动切换为并行批处理(当使用
--batchfile 含 2+ 任务时) - 内置 Provider Gate 并发控制,支持 per-provider 的并发限制和启动间隔
- 失败自动重试(最多 3 次),输出详细成功/失败统计
3. 质量与尺寸预设
normal(1K/快速预览)与 2k(2K/默认/高质量)两档预设- OpenAI GPT Image 2 支持 4K 自定义尺寸(3840x2160)
- 标准宽高比:1:1、16:9、9:16、4:3、3:4、2.35:1
4. 配置管理体系
- 三层配置:CLI 参数 > EXTEND.md(项目/XDG/用户级)> 环境变量
- 首次启动强制引导配置(提供商、模型、质量、保存路径),生成本地 EXTEND.md
- 支持 codex-cli 特殊模式:用 Codex 订阅代替 OpenAI API Key,需本地
codex CLI 登录
技术实现亮点
- 纯 TypeScript + Node.js 标准库,零第三方运行时依赖,供应链攻击面极小
- 路径安全:codex-cli 模式实施 Shell 元字符检查(
SHELL_METACHAR),全局使用 path.resolve() 规范化 - 密钥管理:全部 API 密钥从环境变量读取,无硬编码,支持项目级
.env 隔离 - 网络透明:支持
HTTP_PROXY/HTTPS_PROXY 代理配置,便于企业网络审计
潜在局限与注意事项
| 局限 | 说明 |
|------|------|
| **外部 API 依赖** | 必须向第三方服务商上传提示词和参考图,敏感图像存在数据外发风险 |
| **T3 来源可信度** | 个人开发者维护(jimliu),非知名组织背书,需自行代码审查 |
| **codex-cli 子进程风险** | 该模式 `spawn()` 执行 `codex exec`,虽有过滤但仍属高权限操作 |
| **参考图兼容性碎片化** | 各提供商支持能力差异大,需查阅 `references/providers/*.md` 确认 |
| **OpenAI 与 Codex 权限分离** | Codex/ChatGPT OAuth 不能替代 `OPENAI_API_KEY`,两者为不同授权体系 |
适用人群
- 专业创作者/工作室:需要同时调用多家 API 对比出图质量,或需要批量生成插图、封面、营销素材
- 开发者/自动化场景:将图像生成集成到 CI/CD、内容流水线,依赖稳定的 CLI 接口和 JSON 输出
- 多账户管理用户:通过 EXTEND.md 和 env 变量隔离不同项目的 API 密钥与默认模型
常规风险总结
| 风险类别 | 等级 | 关键控制措施 |
|----------|------|--------------|
| 敏感图像外发 | 中 | 避免向不可信提供商发送参考图;优先本地模型处理敏感内容 |
| API 密钥泄露 | 低 | 专用最小权限密钥;项目级 `.env`;定期轮换 |
| 子进程注入 | 中 | Shell 元字符过滤;可信路径配置;监控 `BAOYU_CODEX_IMAGEGEN_BIN` |
| 供应链攻击 | 极低 | 零第三方依赖;MIT-0 宽松协议 |
整体而言,baoyu-image-gen 是功能完善、代码质量上乘的专业图像生成工具,适合对多提供商支持和批量生产力有明确需求的用户,但需充分理解外部 API 调用的数据隐私 implications。