核心用法
browser-ability 技能为AI Agent提供了基于Chrome DevTools Protocol (CDP)的浏览器自动化能力。核心架构分为两个层级:预定义工具层(有限集合)和原生CDP直连层(兜底方案)。当用户需求超出现有工具覆盖范围时,Agent可直接操控浏览器实例完成任意网页操作。
人机协同认证流程
该技能最显著的设计是强制性的人工介入认证机制:
1. 触发阶段:调用需登录的工具时,系统返回signin_url与signin_id
2. 移交阶段:Agent必须将URL交由用户手动打开,禁止自动化填写凭证
3. 轮询阶段:通过check_signin工具验证登录状态
4. 恢复阶段:用户确认后,携带signin_id重新调用原工具获取数据
典型应用场景
- 电商数据获取:亚马逊订单历史、价格追踪
- 金融账户操作:需强认证的银行、证券平台
- 企业系统对接:内部SSO保护的CRM/ERP系统
显著优点
| 维度 | 优势 |
|------|------|
| 安全架构 | 凭证完全隔离于Agent环境,杜绝密钥泄露风险 |
| 合规适配 | 满足GDPR、PCI-DSS等对自动化登录的严格限制 |
| 扩展能力 | CDP直连模式理论上支持任何网页,不受工具数量限制 |
| 审计追踪 | `signin_id`机制天然形成认证事件日志 |
潜在局限
1. 用户体验中断:强制人工步骤打破对话流畅性,不适合高频场景
2. 超时风险:用户侧登录流程可能因遗忘、网络问题导致会话过期
3. CDP稳定性:远程CDP连接对网络质量敏感,长会话易断开
4. 无沙箱隔离:与宿主浏览器共享Cookie/Storage,存在状态污染可能
适合人群
- 企业自动化团队:需合规对接内部认证系统的RPA开发者
- 数据分析师:定期抓取个人账户数据(如电子账单、投资记录)
- 安全敏感型用户:拒绝将任何凭证托管给AI系统的个人用户
常规风险
- CDP端点暴露:若
CDP_URL配置在公网且无鉴权,可能导致浏览器被未授权控制 - 会话劫持:
signin_id若被拦截,可能允许攻击者冒用已认证会话 - 页面钓鱼:Agent展示的登录URL需经用户人工核验,防止中间人篡改