Prompt Guard

🛡️ AI Agent 运行时安全护盾

AI 增强榜 #21

离线AI运行时安全防护,覆盖650+攻击模式,支持提示注入、供应链投毒、记忆污染等12类威胁检测,MIT开源。

收藏
55.6k
安装
12.8k
版本
3.6.0
CLS 安全性认证2026-07-14
点击查看完整报告 >

使用说明

核心用法

Prompt Guard 是一款专为 AI Agent 设计的运行时安全防御工具,采用100%离线模式运行,内置650+条攻击模式特征库。核心工作流程为:初始化 PromptGuard 实例 → 调用 analyze() 分析输入 → 根据威胁等级执行相应动作(LOG/WARN/BLOCK/BLOCK_NOTIFY)。支持三级模式加载(CRITICAL/HIGH/MEDIUM),可按需启用;提供 LRU 哈希缓存实现 90% 的重复查询性能优化。

显著优点

1. 全面威胁覆盖:12个 SHIELD 分类涵盖提示注入、越狱攻击、工具/MCP滥用、记忆污染、供应链攻击、漏洞利用、社会工程、策略绕过、异常检测、技能武器化等
2. 供应链安全专项:v3.6.0 新增 ClawSecurity 对齐,检测 webhook.site/ngrok 外泄管道、base64 解码执行、__import__ RCE 等供应链攻击签名

3. 多语言支持:内置英/韩/日/中/俄/西/德/法/葡/越 10 语种检测能力

4. 灵活部署:支持完全离线(禁用 API)或可选云端 API 获取抢先体验模式

5. 输出端 DLP:除输入防护外,支持扫描 LLM 响应中的 PII、云凭证、财务数据泄露

潜在局限

  • 模式依赖型检测:基于正则/特征匹配,对零日攻击或高度变形的语义攻击覆盖有限
  • 误报风险:高敏感度模式下可能出现正常技术讨论被拦截(如安全研究人员讨论漏洞利用)
  • API 功能受限:高级功能(DNS 隧道、沙箱逃逸检测)需付费 API 订阅
  • 性能开销:完整扫描(FULL tier)在超长文本场景下可能引入延迟

适合人群

  • 部署 LLM Agent 的企业安全团队
  • 需要符合 ClawSecurity 框架合规要求的组织
  • 对数据隐私敏感、要求本地化处理的用户(金融、医疗、政务场景)
  • AI 应用开发者构建生产级 RAG/Agent 系统

常规风险

| 风险类型 | 说明 |
|---------|------|
| 配置不当 | sensitivity 设置过低导致漏检,或过高导致可用性下降 |
| 缓存投毒 | 若缓存键生成逻辑被预测,可能绕过检测(需配合 canary tokens 使用) |
| API 密钥泄露 | 使用云端 API 时未妥善管理 `PG_API_KEY` 环境变量 |
| 过度依赖 | 单一防御层不足,需结合输入验证、权限最小化等纵深防御 |

技术亮点

  • Typo-Tolerant 检测:v3.4.0 引入拼写容错正则,捕获 "ingore"→"ignore" 等变体绕过
  • 多轮对话防护:v3.6.0 新增跨会话上下文劫持、伪造先前同意的检测
  • Unicode 隐写检测:识别双向字符覆盖、零宽字符、行/段分隔符等隐蔽信道
  • 级联放大防护:阻止无限子 Agent 生成、递归循环、成本爆炸攻击

安全解读

核心用法

Prompt Guard 是一款专为 AI Agent 设计的运行时安全防御技能,通过 650+ 正则/语义模式实时检测输入威胁与输出泄露。核心工作流为:

1. 输入分析guard.analyze(message) 扫描提示词注入、越狱、权限升级等攻击
2. 输出脱敏guard.sanitize_output(llm_response) 识别并脱敏 API 密钥、云凭证、PII 等 17 类敏感数据

3. 分层加载:支持 CRITICAL/HIGH/MEDIUM 三级模式按需加载,内存占用降低 70%

典型集成代码

from prompt_guard import PromptGuard
guard = PromptGuard(config={"sensitivity": "high", "pattern_tier": "high"})
result = guard.analyze(user_input)
if result.action == "block":
    return "[内容被安全系统拦截]"
safe_output = guard.sanitize_output(llm_response)

---

显著优点

| 维度 | 说明 |
|------|------|
| **离线优先** | 600+ 核心模式 100% 本地运行,无需网络即可防护关键攻击面 |
| **检测深度** | 覆盖 12 大 SHIELD 类别:提示注入、供应链污染、内存投毒、动作门绕过、Unicode 隐写、多轮操控、权限升级等 |
| **企业级 DLP** | 输出端识别 AWS/GCP/Azure 凭证、SSN、信用卡、护照号、金融数据等,支持自动脱敏 |
| **性能优化** | SHA-256 指纹缓存(90% 命中节省)、ReDoS 防护、50KB 消息长度限制、速率限制 |
| **多语言支持** | 英/韩/日/中/俄/西/德/法/葡/越 10 语言攻击检测 |
| **透明 API** | 可选云端更新采用纯拉取模式,原始消息永不外发,仅可选匿名化威胁报告 |
| **开源可信** | MIT 许可证,GitHub 公开维护,169 Stars,SECURITY.md 安全策略文档 |

---

潜在局限

| 局限 | 说明 |
|------|------|
| **模式依赖** | 基于正则/规则匹配,对零日攻击或高度语义变体可能漏检(需依赖版本迭代) |
| **API 延迟** | 启用云端更新时,模式拉取可能引入 10s 超时(已设优雅降级) |
| **资源占用** | FULL 模式加载 650+ 正则,低配环境建议用 `pattern_tier: critical` |
| **误报风险** | "paranoid" 敏感度可能将正常技术讨论误判为攻击指令 |

---

适合人群

  • AI Agent 开发者:为自主代理(AutoGPT、Manus 类系统)添加输入/输出安全层
  • 企业安全团队:满足云凭证 DLP、PII 合规、供应链安全审计要求
  • 多语言产品团队:需覆盖全球化用户的跨语言攻击防护
  • 隐私敏感场景:医疗、金融、政务领域要求数据不出境的离线部署

---

常规风险

| 风险项 | 等级 | 缓解措施 |
|--------|------|----------|
| 可选 API 连接 | 低 | 纯拉取模式,可 `PG_API_ENABLED=false` 完全禁用 |
| 默认 Beta API Key | 信息 | 公开文档说明,可通过 `PG_API_KEY` 覆盖 |
| 正则 ReDoS | 低 | 嵌套量词拒绝、长度限制、有效性预检 |
| 模式更新延迟 | 中 | 高危模式 7-14 天开源滞后,关键场景建议订阅 Premium API |

认证结论:经 CLS-Certify 扫描评定 安全等级 S (91/100),代码无危险函数、依赖最小化、防御性设计完善,推荐生产环境部署。

Prompt Guard 内容

blog文件夹
patterns文件夹
prompt_guard文件夹
scripts文件夹
tests文件夹
手动下载zip · 187.4 kB
how-i-secured-my-ai-agent.mdtext/markdown
请选择文件