Gemini Image Gen

🎨 零依赖 AI 绘画,双引擎批量出图

creative榜 #6

基于 Google Gemini API 的零依赖图像生成工具,支持原生生成、Imagen 3、风格预设与批量处理,附带 HTML 画廊输出。

收藏
19k
安装
5.1k
版本
1.3.0
CLS 安全性认证2026-06-23
点击查看完整报告 >

使用说明

核心用法

Gemini Image Gen 是一个纯 Python 标准库实现的图像生成工具,通过调用 Google Gemini API 实现文生图和图生图功能。主要使用场景包括:

1. 快速生成:通过 scripts/gen.py 脚本直接生成图像,支持随机提示词或自定义描述
2. 双引擎支持:Gemini 原生引擎(支持图像编辑)和 Imagen 3 引擎(高质量生成)

3. 风格预设:内置 10 种艺术风格(摄影、动漫、水彩、赛博朋克、极简主义等)

4. 批量处理:支持一次生成多张图像,自动生成带时间戳的输出目录

5. 图生图编辑:使用 Gemini 引擎对现有图像进行智能编辑修改

6. HTML 画廊:自动生成可视化画廊页面展示生成结果

显著优点

  • 零依赖设计:仅使用 Python 标准库,无需额外安装包,部署极简
  • 双引擎灵活切换:Gemini 适合快速迭代和编辑场景,Imagen 3 适合高质量成品输出
  • 丰富的风格预设:覆盖主流视觉风格,降低提示词工程门槛
  • 完善的 CLI 设计:参数清晰,支持随机提示、批量生成、自动目录管理
  • 生态集成:与 AgentGram、agent-selfie 等技能形成内容创作闭环

潜在缺点与局限性

  • API 依赖:完全依赖 Google Gemini API,需自行申请 API 密钥,存在服务可用性风险
  • 计费成本:图像生成消耗 API 额度,批量操作成本累积较快
  • 无本地模型支持:无法离线运行,网络中断即不可用
  • 编辑功能受限:图像编辑仅 Gemini 引擎支持,Imagen 3 无法使用
  • Python 版本依赖:要求 Python 3 环境,无其他语言支持

适合人群

  • AI 艺术创作者与设计师,需要快速原型和风格探索
  • 开发者构建图像生成工作流,追求轻量部署
  • 内容运营人员批量生产社交媒体素材
  • AI Agent 开发者集成视觉生成能力

常规风险

  • API 密钥泄露:环境变量管理不当可能导致密钥泄露
  • 内容安全合规:生成内容需遵守 Google API 使用政策,存在内容过滤可能
  • 速率限制:高频调用易触发 429 错误,需合理控制请求频率
  • 版权归属:AI 生成图像的版权界定仍在发展中,商用需谨慎评估

安全解读

核心用法

Gemini Image Gen 是一个轻量级命令行图像生成工具,通过调用 Google Gemini API 实现文生图与图生图功能。无需安装任何第三方依赖,仅需 Python 3 和标准库即可运行。

主要功能模块:

  • 双引擎支持:原生 Gemini 2.5 Flash 图像模型(支持编辑功能)与 Imagen 3 专用引擎
  • 风格预设系统:内置 10 种专业风格模板(照片级写实、吉卜力动漫、水彩、赛博朋克、极简主义、油画、像素艺术、素描、3D 渲染、波普艺术)
  • 批量生成与画廊:支持一次性生成多张图片并自动输出 HTML 预览画廊
  • 图像编辑:基于 Gemini 引擎的局部编辑能力,可通过自然语言指令修改现有图片

典型工作流:

# 基础生成
python3 scripts/gen.py --prompt "赛博朋克风格猫咪骑霓虹摩托" --style cyberpunk

# Imagen 3 宽屏输出
python3 scripts/gen.py --engine imagen --aspect 16:9 --count 4

# 图像编辑
python3 scripts/gen.py --edit input.png --prompt "将背景改为日落海滩"

---

显著优点

安全架构领先:零外部依赖设计彻底消除供应链攻击风险,743 行代码全部基于 Python 标准库实现,依赖审计得分 100 分。相比需要安装 PyTorch、Diffusers 等重型依赖的本地化方案,部署成本趋近于零。

双模型策略灵活:Gemini 原生模型支持「生成+编辑」闭环,适合迭代创作;Imagen 3 在特定视觉风格上具有优势,用户可按场景切换。风格预设机制通过自动追加高质量提示词前缀,显著降低提示工程门槛。

合规性设计:API 密钥严格通过环境变量管理,符合凭证安全最佳实践;代码不采集任何系统指纹或用户行为数据,GDPR 数据最小化原则完全合规。

---

局限性与潜在风险

功能边界限制:依赖云 API 意味着离线不可用,且受 Google 服务稳定性与速率配额约束(429 错误需人工重试)。图像编辑功能仅限 Gemini 引擎,Imagen 3 不支持此特性。输出分辨率与格式受 API 端点限制,无法自定义模型参数(步数、CFG scale 等)。

成本与隐私权衡:虽然工具本身免费开源,但 Google Gemini API 按调用量计费,批量生成场景需注意成本管控。图片数据需上传至 Google 服务器处理,对敏感内容有合规顾虑的场景需谨慎评估。

T3 来源风险:维护者为个人开发者(Deokhwan Kim),虽代码公开透明、MIT 许可,但缺乏企业级维护承诺。建议关注仓库更新动态,在隔离环境验证新版本后再用于生产。

---

适合人群

  • 快速原型设计师:需要低成本、零配置验证视觉概念的创意工作者
  • 自动化内容运营:需批量生成社交媒体配图、博客插图的技术团队
  • 隐私敏感型用户:不愿安装 PyTorch/CUDA 等重型依赖,偏好「用完即走」的云原生方案
  • 提示词学习者:通过风格预设反向学习高质量提示词构造技巧

---

常规风险提示

  • API 密钥泄露风险:环境变量方式虽优于硬编码,但在多用户共享服务器或 CI/CD 日志中仍可能意外暴露
  • 内容安全过滤:Google API 对提示词有内置安全策略,特定主题(暴力、NSFW、公众人物)可能触发拒绝生成
  • 版本兼容性:Google 频繁更新模型版本号(如 gemini-2.5-flash-image),需关注 --model 参数兼容性

Gemini Image Gen 内容

scripts文件夹
手动下载zip · 11.2 kB
gen.pytext/plain
请选择文件