Guardian — 强制性AI代理安全门控系统
核心用法
Guardian作为AI代理执行破坏性操作前的强制性拦截层,通过三层架构实现风险控制:
1. 操作扫描层:自动检测所有工具调用,识别文件删除(rm/del)、数据库操作(DROP/DELETE)、批量文件处理(>10个文件)、系统级修改(服务/防火墙规则)及外部副作用传输(邮件/未知API)
2. 风险评分层(CARS):将操作分为三级:
- 低风险:临时目录操作,自动放行
- 中风险:配置文件修改、小批量删除,需验证备份后快速通过
- 高风险:根目录删除、数据库DROP、系统文件修改,强制人工审批
3. 决策执行层:基于备份验证状态(Git/Time Machine/云同步/快照工具)决定PROCEED/HALT,验证需在2秒内完成
显著优点
- 零信任原则:代理无法自我批准,高置信度不免验证,"看起来安全"不等于安全
- 性能友好:低风险/已验证备份操作无延迟,不阻塞正常运维
- 防疲劳设计:重复模式会触发标记审查,避免审批疲劳
- JIT窗口机制:紧急场景可降级高风险为中风险处理(但仍需人工审批高风险操作)
- 审计完备:所有决策追加写入不可删日志,JIT操作特殊标记
潜在局限
- 备份依赖:大量中风险场景因备份验证失败而中断,需完善备份基础设施
- 2秒验证限制:复杂备份架构可能无法快速确认状态
- 误拦截风险:非破坏性重命名可能被误判为删除+创建
- 人工瓶颈:高频高风险场景需持续人工介入
- 无原生undo:依赖外部备份系统,不内置版本回滚
适合人群
- 企业AI运维团队:需平衡自动化效率与数据安全的场景
- 多代理协作系统:防止代理链式反应导致级联破坏
- 关键基础设施管理:数据库、生产环境配置变更场景
- 合规敏感行业:金融、医疗等需完整审计追踪的领域
常规风险
- 配置漂移风险:JIT窗口滥用可能导致"临时"绕过成为常态
- 备份虚假安全感:验证通过≠可恢复,备份损坏/加密密钥丢失未检测
- 社会工程攻击:恶意提示可能诱导人工误批准
- 日志存储风险:追加日志若未异地容灾,审计链断裂