核心用法
Chrome Bridge Automation 是一款基于 Midscene.js 的视觉驱动浏览器自动化方案,采用「Bridge 模式」直接操控用户本地 Chrome 浏览器。其核心创新在于纯视觉交互——完全依赖截图进行页面理解与元素操作,无需解析 DOM 结构或依赖可访问性标签(ARIA),因此能兼容任何技术栈渲染的网页,包括 Canvas、WebGL、Shadow DOM 等复杂场景。
操作流程遵循「连接 → 截图 → 执行 → 汇报」的闭环:首先通过 connect --url 建立与目标网页的会话;随后 take_screenshot 获取当前页面视觉状态,由 AI 分析决策;接着使用 act --prompt 以自然语言描述目标操作(如"点击蓝色的提交按钮"),Midscene 内部自动处理点击、输入、滚动、等待等细节;任务完成后必须主动汇总结果,包括关键数据、截图路径及执行摘要;最后仅在用户整体任务结束时 disconnect。
显著优点
1. 零侵入兼容性:不依赖页面源代码或选择器,对 React、Vue、Angular 等现代框架及各类可视化图表一视同仁。
2. 真实浏览器环境:直接复用用户 Chrome 的 Cookies、SessionStorage 和登录态,绕过反爬虫机制,轻松处理需要身份验证的站点。
3. 自然语言驱动:用人类可读的描述替代脆弱的 XPath/CSS 选择器,显著降低维护成本。
4. 多模型支持:兼容 Gemini、Qwen、Doubao Seed、Zhipu 等主流多模态大模型,可按需切换。
潜在缺点与局限性
- 成本与延迟:每次操作需调用视觉大模型进行推理,单次命令约 1 分钟,复杂任务成本较高。
- 环境依赖:必须预装 Chrome 浏览器及 Midscene 扩展,且扩展需保持「Listening」状态。
- 并发限制:需同步执行、单命令串行,无法并行加速。
- 视觉模糊风险:对动态加载、遮挡元素或极小图标可能识别不准。
适合人群
- 需要抓取需登录态数据的分析师与研究员
- 希望自动化复杂 Web 工作流(表单填写、多页导航)的产品与运营
- 测试工程师验证跨框架前端 UI 表现
- 对反爬虫敏感场景有需求的开发者
常规风险
- API 密钥安全:需在环境变量或
.env中配置模型密钥,存在泄露风险;建议使用专用密钥并限制权限。 - 浏览器状态污染:自动化操作可能意外修改用户真实浏览数据(购物车、表单草稿等),敏感操作建议使用无痕窗口或独立 Chrome 实例。
- 操作不可控性:自然语言指令的语义理解存在模糊地带,关键业务建议人工复核截图确认执行结果。
---
> 技术底座:Midscene.js | 扩展地址:Chrome Web Store