核心用法
该技能通过 OpenClaw Browser Tool 实现对 Google Gemini 网页端的自动化操控,完成从登录、生成图片到下载的完整流程,并集成 GeminiWatermarkTool 实现水印去除。
执行流程:
1. 使用 browser(action="open") 打开 Gemini 网页端
2. 通过 snapshot + act(click) 定位并点击「制作图片」按钮
3. 输入视觉描述 Prompt(注意避开「唱」「弹」等会触发音乐生成的关键词)
4. 使用 exec sleep 等待 20-25 秒后 snapshot 轮询生成状态
5. 点击「下载完整尺寸的图片」保存至本地
6. 调用 gwt 命令行工具去除 Gemini 水印
关键约束:
- 必须预先登录 Google 账号
- 严禁使用 `act(kind="wait")`,该操作会导致 8 秒超时并使整个 browser session 不可用
- Prompt 需为纯视觉描述,避免动作类动词
显著优点
- 端到端自动化:从网页交互到水印处理一键完成,无需人工干预
- 零 API 成本:利用 Gemini 免费网页版生图,无需支付 API 费用
- 开源水印工具:集成社区维护的
GeminiWatermarkTool,去除水印效果可靠 - 可扩展性强:支持接入飞书等下游系统,适合工作流整合
潜在缺点与局限性
| 问题 | 说明 |
|------|------|
| 环境依赖重 | 依赖本地 Chrome 浏览器、OpenClaw Gateway、Google 账号登录状态 |
| 稳定性风险 | Browser Tool 可能出现 snapshot 超时、标签页丢失等问题,需人工介入重启 Gateway |
| 速度较慢 | 需 sleep 20-25 秒轮询等待,批量处理效率受限 |
| 平台绑定 | 仅适用于 Google Gemini 网页端,模型版本与功能受官方更新影响 |
| 水印工具局限 | 依赖第三方 GitHub 项目,若网络不可达需手动处理二进制文件 |
适合人群
- 需要免费获取 Gemini 生成图片的个人用户或小型团队
- 希望自动化图片生产流程的内容创作者
- 具备一定技术背景、能处理命令行工具和环境配置的进阶用户
常规风险
- 账号风险:频繁自动化操作可能触发 Google 反爬虫机制,存在账号受限可能
- 工具失效风险:OpenClaw 或 Gemini 网页改版可能导致 selector 失效
- 水印残留风险:水印去除效果依赖
gwt算法,复杂背景可能出现痕迹 - 合规风险:去除水印后的图片用于商业用途需遵守 Google 服务条款