核心用法
baoyu-imagine 是一款命令行 AI 图像生成工具,基于 TypeScript/Bun 构建,集成 9 大主流图像生成 API:
- OpenAI(GPT Image 系列)
- Azure OpenAI
- Google(Gemini 多模态)
- OpenRouter(聚合多模型)
- DashScope/阿里云(通义万象 Qwen-Image)
- MiniMax(支持角色参考一致性)
- Jimeng/即梦(字节火山引擎)
- Seedream/豆包(字节方舟)
- Replicate(开源模型托管)
主要功能
- 文生图:基础文本提示生成,支持宽高比(
--ar)和自定义尺寸(--size) - 图生图:参考图像编辑/变体,支持 Google、OpenAI、Azure、MiniMax 等(注意:Jimeng/Seedream 3.0 不支持)
- 批量生成:JSON 配置文件驱动并行生成(
--batchfile),自动限流重试 - 质量预设:
normal(快速预览)与2k(高精度,默认)两档 - Prompt 文件:支持从 Markdown 文件读取复杂提示词(
--promptfiles)
配置体系
- EXTEND.md:首选项配置(默认模型、质量、路径等),首次使用强制引导设置
- 环境变量:各平台 API Key 及模型覆盖(
OPENAI_API_KEY、DASHSCOPE_API_KEY等) - 优先级:CLI 参数 > EXTEND.md > 环境变量 > 项目/用户级
.env
显著优点
1. 供应商中立:统一接口屏蔽各平台差异,随时切换最优模型
2. 中文生态深度整合:原生支持阿里 DashScope(通义万象)、即梦、豆包等国产服务
3. 参考图能力分层:MiniMax 专精角色一致性,Google/OpenAI 擅长安稳重绘
4. 批量工程化:内置并行调度、自动重试(3 次)、失败隔离,适合内容生产 pipeline
5. Bun 运行时:启动快、依赖轻,支持 bun 或 npx bun 零配置运行
潜在局限
- 首配置门槛:强制 EXTEND.md 首次设置流程,对临时使用不够轻量
- 参考图兼容性碎片化:部分供应商不支持
--ref,需记忆对照表 - 模型 ID 不统一:OpenRouter 需完整路径(
google/gemini-3.1-flash-image-preview),与其他供应商简称不一致 - 质量预设非原生:
--quality为工具层映射,非 API 原生字段,行为可能随供应商更新漂移 - Windows 支持:PowerShell 检测逻辑存在,但主要文档偏向 Unix 风格路径
适合人群
- 设计师/创意工作者:需快速对比多模型输出效果
- 开发者/自动化工程师:构建内容生成 pipeline,需要可编程批量接口
- 中文内容创作者:深度依赖通义万象、即梦等中文优化模型
- 多平台 API 持有者:已有多个供应商 Key,希望统一管理入口
常规风险
- API Key 泄露:环境变量或
.env文件需妥善保管,避免提交至版本控制 - 成本失控:批量模式默认并行,高并发可能触发供应商速率限制或意外账单
- 内容安全:各平台内容政策不同,生成敏感内容可能导致账号限制
- 参考图隐私:
--ref上传本地图片至第三方 API,需确认数据合规性 - 模型淘汰:依赖
gpt-image-1.5、gemini-3-pro-image-preview等预览版模型,存在 API 变更风险