Agent Browser 核心评估
核心用法
Agent Browser 是 Vercel Labs 推出的无头浏览器自动化 CLI,针对 AI Agent 场景优化。核心工作流基于「快照-解析-交互」循环:首先通过 agent-browser open 打开页面,使用 snapshot -i --json 生成可访问性树快照并获取交互元素的确定性 ref(如 @e2);AI 解析 JSON 输出后,通过 ref 执行精确交互(click @e2、fill @e3 "text"),随后重新快照获取页面新状态。
显著优点
1. 确定性选择:基于可访问性树的 ref 系统完全规避传统 CSS/XPath 选择器的脆弱性,DOM 结构变化不影响自动化稳定性
2. 性能优先:专为高性能场景设计,快照输出结构化 JSON 便于 AI 直接解析,无需视觉模型介入
3. 会话隔离:原生支持多 session 并行(--session),适合多用户测试、权限对比等场景
4. 状态持久化:state save/load 支持 cookie/storage 持久化,可跳过重复登录流程
5. 网络控制:支持请求拦截、mock 响应、广告屏蔽,适用于测试与数据抓取
潜在局限
- 无视觉能力:不提供截图/视频流进行视觉分析,纯文本/结构化输出
- 学习成本:需理解可访问性树与 ref 抽象概念,与传统 Playwright/Puppeteer 范式不同
- 生态较新:2024 年 Vercel Labs 实验项目,长期维护承诺未明确
- 安装依赖:需单独下载 Chromium 及 Linux 系统依赖
适合人群
- 构建多步骤 Agent 工作流的开发者
- 需要高稳定性、不依赖视觉的网页自动化场景
- 同时进行多会话测试的 QA/自动化工程师
- 追求比传统工具更轻量、更 AI-native 的方案
常规风险
- 无头浏览器操作可能被目标站检测并拦截
- 高频自动化可能触发反爬虫机制
- 状态文件包含敏感 cookie,需妥善保管