核心用法
本技能利用 Playwright 浏览器自动化框架,操控 Chrome/Chromium 浏览器打开 ChatGPT 网页版,模拟用户输入提示词、等待图像生成、自动提取并保存结果图片。支持从 JSON 文件批量读取提示词,按顺序执行生成任务,输出编号图片文件及结构化日志。
主要功能特性:
- 批量生成:从
prompts.json读取多条提示词自动执行 - 断点续传:支持
--start参数从指定位置恢复任务 - 无头模式:通过
--headless实现后台静默运行 - 会话持久化:首次登录后保存状态,后续免重复验证
显著优点
1. 零API成本:直接操作网页版,无需 OpenAI API 额度
2. 完整功能访问:可使用 ChatGPT 原生图像生成能力(DALL·E 3/4)
3. 输出标准化:自动生成编号文件与 JSONL 日志,便于集成下游工作流
4. 技术门槛低:仅需 Node.js 环境,无需复杂 AI 工程经验
潜在缺点与局限性
| 维度 | 说明 |
|------|------|
| **稳定性风险** | 网页版 DOM 结构变化会导致选择器失效,需持续维护 |
| **账号依赖** | 需有效 ChatGPT Plus/Pro 订阅,免费用户无图像生成权限 |
| **速率限制** | 受 OpenAI 网页端并发策略约束,高频调用可能触发风控 |
| **法律灰色地带** | 自动化工具违反 OpenAI 服务条款第 3 条(禁止自动化访问)|
| **资源占用** | 完整 Chromium 实例内存占用高(~300-500MB/实例)|
适合人群
- 需要批量生成素材但 API 预算有限的内容创作者
- 希望将 ChatGPT 图像能力集成到自动化工作流的开发者
- 研究浏览器自动化或 RPA 的技术爱好者
常规风险
- 账号封禁:OpenAI 可能检测并封禁自动化行为账户
- 数据隐私:登录凭证与生成内容流经第三方脚本
- 维护成本:ChatGPT 界面更新频率高,脚本需持续适配
- 输出不可控:图像生成质量与网页版一致,无额外参数调优能力