Baoyu Imagine

🎨 九平台合一的 AI 图像生成中枢

多供应商 AI 图像生成工具,支持 OpenAI、Google、阿里通义、即梦等 9 大平台,提供文生图、图生图、批量生成及参考图功能。

收藏
9.5k
安装
2.6k
版本
1.0.0
CLS 安全性认证2026-08-09
点击查看完整报告 >

使用说明

核心用法

baoyu-imagine 是一款命令行 AI 图像生成工具,基于 TypeScript/Bun 构建,集成 9 大主流图像生成 API:

  • OpenAI(GPT Image 系列)
  • Azure OpenAI
  • Google(Gemini 多模态)
  • OpenRouter(聚合多模型)
  • DashScope/阿里云(通义万象 Qwen-Image)
  • MiniMax(支持角色参考一致性)
  • Jimeng/即梦(字节火山引擎)
  • Seedream/豆包(字节方舟)
  • Replicate(开源模型托管)

主要功能

  • 文生图:基础文本提示生成,支持宽高比(--ar)和自定义尺寸(--size
  • 图生图:参考图像编辑/变体,支持 Google、OpenAI、Azure、MiniMax 等(注意:Jimeng/Seedream 3.0 不支持)
  • 批量生成:JSON 配置文件驱动并行生成(--batchfile),自动限流重试
  • 质量预设normal(快速预览)与 2k(高精度,默认)两档
  • Prompt 文件:支持从 Markdown 文件读取复杂提示词(--promptfiles

配置体系

  • EXTEND.md:首选项配置(默认模型、质量、路径等),首次使用强制引导设置
  • 环境变量:各平台 API Key 及模型覆盖(OPENAI_API_KEYDASHSCOPE_API_KEY 等)
  • 优先级:CLI 参数 > EXTEND.md > 环境变量 > 项目/用户级 .env

显著优点

1. 供应商中立:统一接口屏蔽各平台差异,随时切换最优模型
2. 中文生态深度整合:原生支持阿里 DashScope(通义万象)、即梦、豆包等国产服务

3. 参考图能力分层:MiniMax 专精角色一致性,Google/OpenAI 擅长安稳重绘

4. 批量工程化:内置并行调度、自动重试(3 次)、失败隔离,适合内容生产 pipeline

5. Bun 运行时:启动快、依赖轻,支持 bunnpx bun 零配置运行

潜在局限

  • 首配置门槛:强制 EXTEND.md 首次设置流程,对临时使用不够轻量
  • 参考图兼容性碎片化:部分供应商不支持 --ref,需记忆对照表
  • 模型 ID 不统一:OpenRouter 需完整路径(google/gemini-3.1-flash-image-preview),与其他供应商简称不一致
  • 质量预设非原生--quality 为工具层映射,非 API 原生字段,行为可能随供应商更新漂移
  • Windows 支持:PowerShell 检测逻辑存在,但主要文档偏向 Unix 风格路径

适合人群

  • 设计师/创意工作者:需快速对比多模型输出效果
  • 开发者/自动化工程师:构建内容生成 pipeline,需要可编程批量接口
  • 中文内容创作者:深度依赖通义万象、即梦等中文优化模型
  • 多平台 API 持有者:已有多个供应商 Key,希望统一管理入口

常规风险

  • API Key 泄露:环境变量或 .env 文件需妥善保管,避免提交至版本控制
  • 成本失控:批量模式默认并行,高并发可能触发供应商速率限制或意外账单
  • 内容安全:各平台内容政策不同,生成敏感内容可能导致账号限制
  • 参考图隐私--ref 上传本地图片至第三方 API,需确认数据合规性
  • 模型淘汰:依赖 gpt-image-1.5gemini-3-pro-image-preview 等预览版模型,存在 API 变更风险

安全解读

核心用法

baoyu-imagine是一款多提供商聚合的AI图像生成工具,通过统一CLI接口调用9大主流AI图像服务:OpenAI、Google Gemini、Azure OpenAI、OpenRouter、阿里云DashScope(通义万象)、MiniMax、字节跳动Jimeng(即梦)、Seedream(豆包)以及Replicate。

基础操作:使用Bun或npx运行主脚本,通过--prompt指定提示词、--image指定输出路径即可完成单图生成。支持--ar设置长宽比(1:1、16:9等)、--quality选择画质(normal/2k)、--size自定义分辨率。

高级功能--ref参数实现参考图生成(支持Google多模态、OpenAI图像编辑、MiniMax主体参考等模式);--promptfiles从文件读取提示词,适合复杂场景;--batchfile启用批量并行生成,自动调度多任务队列,内置重试机制。

配置管理:首次使用需完成EXTEND.md配置(提供商选择、默认模型、画质预设等),支持项目级与用户级双重配置覆盖。环境变量与CLI参数均可动态覆盖配置,灵活适应不同工作流。

显著优点

提供商生态丰富:覆盖国内外9家主流AI图像服务商,用户可根据成本、质量、特色能力自由选择。阿里云DashScope擅长中文文字渲染与21:9宽幅海报;MiniMax精于人物肖像一致性;Google Gemini支持原生多模态理解。

功能覆盖全面:从简单的文生图到复杂的图生图编辑,从单张生成到批量并行,从固定比例到自定义尺寸,满足从快速原型到专业生产的全链条需求。

工作流集成友好:支持prompt文件管理、JSON批量配置、环境变量注入,便于嵌入CI/CD、内容生产流水线等自动化场景。TypeScript实现保证类型安全,Bun运行时带来高性能执行。

智能降级与容错:自动检测可用API密钥、智能选择提供商;网络失败自动重试3次;批量模式内置并发控制与错误隔离,单图失败不影响整体批次。

潜在缺点与局限性

配置门槛较高:首次使用强制要求完成EXTEND.md配置流程,对新手不够友好。9家提供商各自的模型命名、尺寸限制、参考图支持度差异较大,需要一定学习成本。

运行时依赖特定:必须使用Bun或npx bun执行,原生Node.js不支持。部分Windows环境可能需要额外配置。

参考图支持不均衡:Jimeng、Seedream 3.0等不支持参考图功能;各提供商对参考图的理解方式差异显著(Google多模态理解 vs MiniMax主体一致性),实际效果需要反复调试。

中文生态适配待完善:虽然支持DashScope、Jimeng等国产服务,但文档与CLI交互仍以英文为主,部分参数命名(如--ar)对国内用户不够直观。

适合的目标群体

  • 内容创作者与设计师:需要快速生成概念图、插画、海报原型,或批量生产社交媒体素材
  • 开发者与技术团队:构建AI图像工作流、集成自动化内容生产管道
  • 电商与营销运营:批量生成商品场景图、广告素材,利用参考图保持品牌视觉一致性
  • AI应用原型验证:快速对比多提供商生成效果,评估最优成本-质量方案

使用风险

API成本累积:图像生成API按调用量计费,批量模式若未合理设置并发上限可能导致费用激增。建议配置BAOYU_IMAGE_GEN_MAX_WORKERS控制成本。

密钥管理隐患:Skill依赖环境变量读取多组API密钥,共享环境或日志泄露可能导致密钥暴露。建议配合专用密钥管理工具使用,避免在版本控制中提交.env文件。

服务可用性波动:9家提供商的SLA与地区可用性各异,部分国内服务(Jimeng、Seedream)存在网络访问限制,建议准备多提供商备用方案。

输出内容合规:AI生成图像可能涉及版权、肖像权及内容审核问题,商业使用前需确认各提供商的服务条款与本地法规要求。

代理环境兼容性:Google provider在HTTP_PROXY环境下回退至curl实现,可能受本地curl版本与证书配置影响。

Baoyu Imagine 内容

references文件夹
config文件夹
scripts文件夹
providers文件夹
手动下载zip · 63.8 kB
first-time-setup.mdtext/markdown
请选择文件