核心用法
Browser Automation 是一款基于 Midscene.js 的视觉驱动浏览器自动化技能,通过 npx @midscene/web@1 命令行工具实现。其核心工作流程为:使用 connect 连接目标网页 → take_screenshot 获取当前页面状态 → 基于自然语言描述执行 act 操作 → 完成后 close 关闭浏览器。
该技能采用纯视觉交互模式,完全依赖截图进行页面理解,无需解析 DOM 结构或依赖可访问性标签,因此能够操作任何可见元素,不受前端技术栈限制。底层通过 Puppeteer 启动无头 Chrome,浏览器实例在 CLI 调用间保持持久化,支持多步骤工作流的连续执行。
显著优点
- 零 DOM 依赖:基于视觉模型理解页面,兼容 React/Vue/Angular 等任何前端框架,甚至能操作 Canvas、SVG 等复杂渲染内容
- 自然语言驱动:使用日常描述如"点击蓝色的提交按钮"而非 CSS 选择器,大幅降低自动化脚本编写门槛
- 跨页面状态保持:单次连接后浏览器持续运行,支持登录态保持、多页面跳转等复杂场景
- 批量操作优化:支持将多个连续操作合并为单个
act命令,减少 AI 推理轮次,提升执行效率
潜在缺点与局限性
- 模型依赖性强:必须配置具备视觉 grounding 能力的多模态模型(如 Doubao Seed 1.6、Qwen3-VL、Gemini-3 等),模型质量直接影响操作准确性
- 环境配置复杂:需手动设置
MIDSCENE_MODEL_API_KEY等环境变量,对非技术用户存在门槛 - 执行耗时较长:单次
act命令涉及 AI 推理和屏幕交互,典型耗时约 1 分钟,复杂任务可能更久 - 同步执行限制:必须严格单步同步执行,禁止后台运行,无法并行处理多个页面
适合人群
- 数据采集需求者:需要抓取网页内容但不想处理反爬机制的分析师、研究员
- QA 测试工程师:进行前端 UI 回归测试、跨浏览器兼容性验证
- 非技术运营人员:希望通过自然语言而非代码实现自动化网页操作
- AI Agent 开发者:构建需要网页交互能力的智能体应用
常规风险
- API 成本风险:视觉模型调用费用通常高于纯文本模型,高频使用可能产生显著成本
- 页面变化敏感:UI 布局或样式变更可能导致视觉识别失败,需维护稳定的提示词策略
- 隐私数据暴露:截图可能包含敏感信息,需注意本地文件存储安全
- 超时与失败处理:网络波动或页面加载异常可能导致命令中断,需设计重试机制