Midscene Automations Skills for Browser with Bridge

🌐 视觉驱动操控你的 Chrome 浏览器

基于视觉的浏览器自动化工具,通过截图操控用户真实 Chrome 浏览器,免 DOM 解析,保留登录态与 Cookie,适合复杂网页交互与数据抓取。

收藏
4.2k
安装
1.5k
版本
1.0.3
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Chrome Bridge Automation 是一款基于 Midscene.js 的视觉驱动浏览器自动化方案,采用「Bridge 模式」直接操控用户本地 Chrome 浏览器。其核心创新在于纯视觉交互——完全依赖截图进行页面理解与元素操作,无需解析 DOM 结构或依赖可访问性标签(ARIA),因此能兼容任何技术栈渲染的网页,包括 Canvas、WebGL、Shadow DOM 等复杂场景。

操作流程遵循「连接 → 截图 → 执行 → 汇报」的闭环:首先通过 connect --url 建立与目标网页的会话;随后 take_screenshot 获取当前页面视觉状态,由 AI 分析决策;接着使用 act --prompt 以自然语言描述目标操作(如"点击蓝色的提交按钮"),Midscene 内部自动处理点击、输入、滚动、等待等细节;任务完成后必须主动汇总结果,包括关键数据、截图路径及执行摘要;最后仅在用户整体任务结束时 disconnect

显著优点

1. 零侵入兼容性:不依赖页面源代码或选择器,对 React、Vue、Angular 等现代框架及各类可视化图表一视同仁。
2. 真实浏览器环境:直接复用用户 Chrome 的 Cookies、SessionStorage 和登录态,绕过反爬虫机制,轻松处理需要身份验证的站点。

3. 自然语言驱动:用人类可读的描述替代脆弱的 XPath/CSS 选择器,显著降低维护成本。

4. 多模型支持:兼容 Gemini、Qwen、Doubao Seed、Zhipu 等主流多模态大模型,可按需切换。

潜在缺点与局限性

  • 成本与延迟:每次操作需调用视觉大模型进行推理,单次命令约 1 分钟,复杂任务成本较高。
  • 环境依赖:必须预装 Chrome 浏览器及 Midscene 扩展,且扩展需保持「Listening」状态。
  • 并发限制:需同步执行、单命令串行,无法并行加速。
  • 视觉模糊风险:对动态加载、遮挡元素或极小图标可能识别不准。

适合人群

  • 需要抓取需登录态数据的分析师与研究员
  • 希望自动化复杂 Web 工作流(表单填写、多页导航)的产品与运营
  • 测试工程师验证跨框架前端 UI 表现
  • 对反爬虫敏感场景有需求的开发者

常规风险

  • API 密钥安全:需在环境变量或 .env 中配置模型密钥,存在泄露风险;建议使用专用密钥并限制权限。
  • 浏览器状态污染:自动化操作可能意外修改用户真实浏览数据(购物车、表单草稿等),敏感操作建议使用无痕窗口或独立 Chrome 实例。
  • 操作不可控性:自然语言指令的语义理解存在模糊地带,关键业务建议人工复核截图确认执行结果。

---

> 技术底座:Midscene.js | 扩展地址:Chrome Web Store

Midscene Automations Skills for Browser with Bridge 内容

手动下载zip · 5.5 kB
skill-card.mdtext/markdown
请选择文件