核心用法
image-generation 是为 OpenClaw 生态设计的原生图像生成技能,通过 OpenRouter 统一接口调用主流 AI 绘图模型。用户只需提供文本提示词(Prompt),即可快速生成高质量图像,支持文生图(T2I)和图生图(I2I)两种模式。
关键特性:
- 双模型架构:默认集成 ByteDance Seedream 4.5(文生图)与 Google Gemini 2.5 Flash Image(图生图)
- 灵活尺寸控制:支持 1K/2K/4K 三档分辨率,覆盖 1:1 至 21:9 等 10 种宽高比
- 原子化安全存储:所有生成结果强制写入
.sisyphus/generated/目录,避免路径遍历风险 - 标准化 CLI 接口:符合 OpenClaw cli-contract 规范,返回结构化 JSON 与标准化退出码
典型工作流:
1. 配置 OPENROUTER_API_KEY 至 ~/.openclaw/openclaw.json
2. 通过 node skills/image-generation/scripts/generate.js --prompt "描述词" --size 2K --aspect 16:9 触发生成
3. 接收本地文件路径与元数据,直接用于下游任务
显著优点
1. 生态深度集成:专为 OpenClaw 优化,支持 primaryEnv 快捷配置、启动时连通性预检、符合 cli-contract 的退出码体系
2. 模型聚合优势:借助 OpenRouter 中转,无需单独申请各平台 API Key,即可调用 Seedream、DALL-E 3、Claude Image 等多模型
3. 成本效率:2K 与 1K 同价策略,推荐日常使用 2K 即可获得显著画质提升
4. 安全优先设计:强制安全目录写入、明确的退出码定义(CONFIG_ERROR/API_ERROR/FS_ERROR)、环境变量隔离配置
潜在缺点与局限性
1. 供应商锁定:v1 版本仅限 OpenRouter,不支持直接调用 Anthropic、Replicate 或 Stability AI 原生接口,存在单一依赖风险
2. 分辨率模型兼容:并非所有模型支持 4K,部分模型上限为 2K,需查阅可用模型列表
3. 成本波动:4K 生成成本约为 1K/2K 的 2 倍,高频使用需关注 OpenRouter 计费策略
4. 网络依赖:所有生成均为云端 API 调用,离线环境不可用,存在网络延迟与超时风险
适合人群
- OpenClaw 用户:寻求 IDE 内原生图像生成能力,避免切换至独立绘图工具
- 开发者/自动化工作流:需要通过 CLI 批量生成图片、集成至 CI/CD 或脚本管道
- 多模型尝鲜者:希望快速对比 Seedream、Gemini、DALL-E 等不同模型风格的用户
- 合规敏感场景:需要原子化本地存储、明确审计路径的企业环境
常规风险
| 风险类型 | 说明 | 缓解措施 |
|---------|------|---------|
| **API 密钥泄露** | `OPENROUTER_API_KEY` 配置于本地 JSON 文件,存在误提交风险 | 使用 `.gitignore` 排除配置目录,优先通过环境变量注入 |
| **生成内容合规** | AI 模型可能输出版权敏感或不适宜内容 | 遵循 OpenRouter 使用政策,人工审核商用场景输出 |
| **成本失控** | 4K 高频生成或循环调用导致账单激增 | 设置 OpenRouter 预算告警,生产环境限制 `--size` 参数 |
| **服务可用性** | OpenRouter 或上游模型商服务中断 | 实现退出码 `2`(API_ERROR)的降级逻辑,准备本地备选方案 |
| **路径遍历** | 若绕过 CLI 直接调用脚本,`-output` 参数可能存在注入风险 | 严格使用提供的 CLI 包装器,遵循 `.sisyphus` 安全目录约定 |
技术备注
- 许可证:MIT(开源可商用)
- 版本:v0.2.1
- 兼容性:OpenClaw、Claude Code、OpenCode、Antigravity
- 环境要求:Node.js 运行时,仅需
OPENROUTER_API_KEY即可启动