核心功能
nano-banana-2-direct 是基于 Google Gemini 3.1 Flash Image Preview API 的图像生成与编辑工具,采用直接 API 调用模式,摆脱了对 inference.sh 的依赖。该 skill 同时支持文生图(text-to-image)和图生图(image-to-image)两种工作流,提供 1K(默认)、2K、4K 三种分辨率选项,可满足从快速草图到高质量成品输出的全链路需求。
显著优势
架构简洁:纯 Python 实现,仅依赖 google-genai 和 pillow 两个核心库,通过 uv 快速部署;成本友好:推荐「草稿→迭代→定稿」工作流,先用 1K 快速验证提示词,确认后再用 4K 输出,避免高分辨率试错的资源浪费;灵活编辑:支持上传现有图片作为基底,通过自然语言指令完成风格转换、元素增删、光影调整等精细化操作;安全调用:API Key 支持命令行参数与环境变量双模式,脚本内置预检机制(uv 可用性、密钥有效性、输入文件存在性),降低运行时故障率。
潜在局限
预览版稳定性:Gemini 3.1 Flash Image 尚处 Preview 阶段,API 行为、速率限制或可用性可能变动;配额敏感:Google AI Studio / Vertex AI 的免费层级有每日请求上限,高并发场景需准备多 Key 轮换或付费方案;输出可控性:与专用图像模型(如 Midjourney、Stable Diffusion XL)相比,Gemini 在复杂构图、精细文字渲染、特定艺术风格一致性方面偶有波动;本地依赖:虽无需 inference.sh,但仍需 Python 3 环境及 uv 包管理器,对纯容器/无 Python 环境不够友好。
适合人群
- 需要快速原型验证的创意工作者与提示词工程师
- 追求低成本迭代的独立开发者与小团队
- 希望无缝集成到 OpenClaw 工作流、避免额外推理服务的用户
- 有现有素材需二次编辑(换风格、调光影、修元素)的设计师
常规风险
| 风险类型 | 说明 | 缓解措施 |
|---------|------|---------|
| 密钥泄露 | 命令行 `--api-key` 可能残留于 shell 历史 | 优先使用 `GEMINI_API_KEY` 环境变量 |
| 配额耗尽 | 高频调用触发 Google 速率限制 | 实施阶梯式生成策略,准备备用 Key |
| 路径错误 | `--input-image` 指向不存在的文件 | 利用预检 `test -f` 提前验证 |
| 版权争议 | 生成内容可能包含训练数据相似元素 | 商用前进行人工审核与必要修改 |
| 输出位置 | 若未注意当前工作目录,文件可能保存到意外位置 | 严格遵循「不 cd 进 skill 目录」的执行规范 |