核心用法
baoyu-imagine 是一款面向开发者和创意工作者的企业级 AI 图像生成工具,通过统一 CLI 接口屏蔽 10+ 主流图像模型(OpenAI GPT-Image-2、Google Gemini、Azure OpenAI、阿里 DashScope 通义万相、智谱 Z.AI GLM-Image、MiniMax、即梦 Jimeng、豆包 Seedream、Replicate 等)的 API 差异。
基础工作流:首次运行强制配置(Step 0 阻塞式初始化)→ 生成 EXTEND.md 偏好文件 → 执行单图/批量生成。核心指令遵循 ${BUN_X} scripts/main.ts --prompt "描述" --image 输出路径 范式,支持 --ar 宽高比、--ref 参考图、--quality 2k 画质预设等参数。
批量模式:通过 --batchfile batch.json --jobs N 启用并行工作流,内置智能限流(默认 10 并发、单图 3 次重试),适合素材库建设、内容批量生产。
显著优点
1. 厂商中立的统一抽象:同一套 CLI 语法驱动差异化严重的各平台 API,大幅降低多模型切换成本
2. 企业级工程细节:XDG 配置规范、环境变量层级覆盖、EXTEND.md 偏好持久化、批处理限流与熔断
3. 参考图生态完整:支持 Google 多模态、OpenAI 图像编辑、Replicate 家族、MiniMax 主体参考等 6+ 种参考图工作流
4. OpenAI 兼容网关适配:提供 openai-native 与 ratio-metadata 两种方言切换,适配私有网关
潜在局限
- 初始化门槛:首次强制配置可能打断快速体验;EXTEND.md schema 学习成本
- 参考图碎片化:各厂商参考图支持度差异大(如 Jimeng/Seedream 3.0 完全不支持),需查阅 per-provider 文档
- Replicate 单图限制:
--n强制为 1,与其他厂商行为不一致 - 方言限制:
ratio-metadata暂不支持参考图编辑模式
适合人群
- 需要统一管控多模型 API 的 AI 中台/平台开发者
- 追求批量化、自动化内容生产的插画师、运营设计师
- 构建私有图像生成网关的基础设施工程师
- 熟悉 CLI 环境、能接受配置文件管理的进阶用户
常规风险
- API 密钥泄露:10+ 组环境变量需妥善管理,建议配合密钥管理工具
- 成本失控:批量并行模式下费用累积快,需配合
--jobs限流与预算告警 - 合规风险:部分厂商(即梦、豆包)为字节/阿里国内服务,需关注内容审核策略与数据跨境合规
- 输出稳定性:AI 图像生成存在内容安全拦截、版权争议等通用风险,关键商用场景建议人工审核