OpenGuardrails

🔒 AI Agent 提示注入防护盾牌

安全工具榜 #4

基于 SOTA 模型的间接提示注入检测插件,87.1%-97.3% F1 得分,自动拦截邮件、网页、文档中的隐藏恶意指令,保护 AI Agent 安全。

收藏
9.7k
安装
2.4k
版本
3.0.0
CLS 安全性认证2026-07-04
点击查看完整报告 >

使用说明

核心用法

OpenGuardrails 是 OpenClaw 平台的插件,专用于检测和阻断间接提示注入攻击。它通过 Hook tool_result_persist 事件,对 AI Agent 读取的外部长内容(邮件、网页、文档等)进行实时扫描。

处理流程:内容被分割为 4000 字符的块(200 字符重叠)→ 使用 OG-Text 模型逐块分析 → 聚合判定 → 阻断或放行。提供 /og_status/og_report/og_feedback 三个管理命令。

显著优点

1. 检测性能领先:英文 F1 达 87.1%,多语言高达 97.3%,属业界 SOTA 水平
2. 零侵入部署:以插件形式工作,无需修改 Agent 核心逻辑

3. 灵活配置:支持阻断模式与仅日志模式,可调整分块大小和超时时间

4. 反馈闭环:内置误报/漏报反馈机制,持续优化模型

5. 实时监控:提供日志追踪和定时报告功能

潜在局限

  • 延迟开销:LLM 逐块分析可能增加 100-500ms 响应延迟(取决于内容长度)
  • 成本因素:每次检测消耗 LLM Token,高频场景需评估成本
  • 边界情况:极端混淆的注入可能逃逸检测(F1 未达 100%)
  • 依赖外部服务:OG-Text 模型依赖 OpenGuardrails 云端或本地部署

适合人群

  • 处理不可信外部内容的 AI Agent(邮件助手、网页爬虫、文档分析器)
  • 金融、医疗、企业级 RAG 系统等对安全合规要求高的场景
  • 已使用 OpenClaw 网关框架的开发者

常规风险

  • 误阻断风险:正常安全文档可能被误判,建议初期启用 log-only 模式调优
  • 单点依赖:若 OpenGuardrails 服务不可用,检测功能失效
  • 对抗性绕过:攻击者可能针对分块策略设计跨块注入攻击
  • 隐私考量:内容需上传至检测服务,敏感数据需确认数据处理协议

安全解读

核心用法

OpenGuardrails 是 OpenClaw 生态的安全插件,用于检测并阻断间接提示词注入攻击——即隐藏在邮件、网页、文档等长文本中的恶意指令。其工作流程为:将长内容分块(4000字符/块,200字符重叠)→ 使用 OG-Text 模型逐块分析 → 聚合判定是否包含注入 → 阻断或放行。

插件提供三条管理命令:

  • /og_status:查看配置与统计(检测次数、阻断数、平均耗时)
  • /og_report:查看近期检测详情(可疑内容片段、判定原因)
  • /og_feedback:上报误报或漏报以改进模型

配置项支持 blockOnRisk(检测到即阻断/仅日志)、maxChunkSize(分块大小)、timeoutMs(超时)等。

显著优点

1. 检测性能领先:英文 F1 达 87.1%,多语言 F1 达 97.3%,属于业界 SOTA 水平
2. 即插即用:通过 openclaw plugins install 一键安装,自动 hook 到 tool_result_persist 事件

3. 场景针对性强:专门解决 AI Agent 读取外部不可信内容时的安全盲区

4. 来源可信:GitHub 组织账号维护,npm 包已发布,社区活跃(T2 来源等级)

潜在缺点与局限性

1. 硬编码 API Key:代码中直接嵌入 sk-xxai-model-0e5a52bd1c70cca03d5f67fe1c2ca406,存在凭证泄露风险
2. 数据外泄风险:所有检测内容必须发送至 api.openguardrails.com,用户敏感文档可能被第三方留存

3. 强外部依赖:核心功能完全依赖外部 API,单点故障风险高,无本地降级方案

4. 隐私合规问题:本地 SQLite 存储分析日志,缺乏自动清理机制,可能违反 GDPR 数据最小化原则

适合人群

  • 使用 OpenClaw 构建 AI Agent 的开发者
  • 需要处理外部不可信长文本(邮件、网页抓取、用户上传文档)的场景
  • 能接受数据出域、对检测准确率要求高于数据隐私的场景

常规风险

| 风险类型 | 等级 | 说明 |
|---------|------|------|
| 凭证泄露 | 🔴 高 | 硬编码 API Key 可被提取滥用 |
| 数据外泄 | 🔴 高 | 敏感内容发送至第三方 API |
| 服务可用性 | 🟠 中 | 网络/API 故障导致检测失效 |
| 隐私合规 | 🟠 中 | 本地日志无自动清理,GDPR 不合规 |

使用建议:生产环境部署前务必移除硬编码密钥,改用环境变量配置;评估数据出域风险是否可接受;高敏感场景建议叠加其他本地检测层。

OpenGuardrails 内容

agent文件夹
memory文件夹
手动下载zip · 117.4 kB
config.tstext/plain
请选择文件