Prompt Guard

🛡️ 577+模式离线守护AI对话安全

AI 增强榜 #21

面向LLM应用的577+模式离线注入防御系统,支持拼写容错、分层检测与输出DLP,无需联网即可部署。

收藏
43.9k
安装
12.8k
版本
3.5.0
CLS 安全性认证2026-07-12
点击查看完整报告 >

使用说明

Prompt Guard v3.4.0 综合评估

核心定位

Prompt Guard 是一款面向大语言模型(LLM)应用的离线优先型提示注入防御系统,由 Seojoon Kim 开发,当前版本 v3.4.0 内置 577+ 条检测模式,覆盖 10 种语言的攻击变体。其设计哲学强调零依赖运行——核心功能完全离线,API 仅作为可选增强。

核心用法

1. 分层检测架构:采用三级模式加载(CRITICAL/HIGH/MEDIUM),用户可按场景灵活配置。CRITICAL 层(~45 模式)常驻内存,涵盖密钥外泄、系统命令注入、反向 Shell 等高危行为;HIGH 层(~82 模式)默认加载,覆盖越狱、指令覆盖、Token 走私;MEDIUM 层(~100+)按需激活,处理角色操纵等中风险场景。

2. 容错匹配引擎:v3.4.0 新增拼写容错正则(typo-tolerant regex),可捕获 "ingore"→"ignore"、"instrct"→"instruct" 等变体攻击,显著提升对抗字符级扰动的鲁棒性。

3. 全链路防护:不仅检测输入(analyze()),还支持输出 DLP(scan_output()/sanitize_output()),防止模型误泄敏感信息。

4. CLI 与缓存:内置命令行工具与 LRU 缓存(命中率达 70%+),适合高吞吐生产环境。

显著优点

  • 离线安全性:核心模式库本地常驻,无网络也可阻断攻击,消除外部依赖的供应链风险。
  • 高性能设计:分层加载 + 哈希缓存,90% 重复查询可命中缓存,延迟可控。
  • 多语言覆盖:支持英日韩中等 10 语种的注入检测,适配全球化部署。
  • 透明治理:MIT 开源协议,模式库 YAML 可审计,无黑箱检测逻辑。
  • 生态集成:预留 HiveFence 威胁情报上报接口,支持社区驱动的模式更新。

潜在局限与风险

1. 模式维护负担:577+ 条正则依赖人工维护,新型攻击(如基于语义的对抗样本)可能滞后于社区发现。
2. API 依赖风险:Early Access/Premium 模式需联网获取,虽承诺"7-14 天开源滞后",但企业用户若依赖 Premium 的 DNS 隧道/隐写检测,实则形成供应商锁定。

3. 误报权衡:PARANOID 级别可能过度拦截正常查询(如含 "ignore" 的合法技术讨论),需业务层二次复核。

4. 无模型级防御:纯基于模式匹配,无法抵御需要理解深层语义的上下文操控(如多轮对话累积诱导)。

适合人群

  • AI 应用开发者:需快速为 ChatBot、Agent 系统添加防护层。
  • 企业安全团队:寻求可审计、可本地部署的合规方案(金融、医疗等敏感场景)。
  • 红队/安全研究员:作为基线工具评估 LLM 应用的防御水位。

常规风险

  • 配置误用:关闭 API 后未及时更新本地模式库,导致防护真空。
  • 缓存投毒:若缓存键生成逻辑泄露,攻击者可能构造碰撞键绕过检测(需验证键是否含盐值)。
  • 输出 DLP 漏报:复杂格式的敏感信息(如图片隐写)超出当前输出扫描能力。

结论

Prompt Guard 是生产就绪的开源 LLM 防护基线,其分层架构与离线优先设计在同类工具中稀缺。建议作为多层防御的"第一层"使用,搭配语义级监控(如异常行为检测)以弥补模式匹配的固有盲区。

安全解读

核心用法

Prompt Guard 是一款专为大型语言模型(LLM)设计的提示注入防御工具,提供开箱即用的安全过滤能力。核心使用方式极其简洁:

from prompt_guard import PromptGuard
guard = PromptGuard()  # API默认启用,内置beta密钥
result = guard.analyze("用户输入")
if result.action == "block":
    return "已拦截"

支持完全离线运行(PG_API_ENABLED=false),内置577+攻击模式库,覆盖10种语言。采用三级模式加载策略:CRITICAL(~45模式,始终加载)、HIGH(~82模式,默认)、MEDIUM(~100+模式,按需)。v3.4.0新增错别字容忍检测(如'ingore'识别为'ignore'变体)、AI推荐投毒检测等新能力。

显著优点

1. 专业级防御深度

  • 577+ handcrafted 攻击模式,覆盖提示注入、越狱、角色操控、凭证窃取、供应链攻击等完整攻击面
  • 多级 severity 体系(SAFE→LOW→MEDIUM→HIGH→CRITICAL),支持差异化响应策略
  • 错别字容忍与多编码解码(Base64/Hex/ROT13/Unicode等),有效对抗混淆攻击

2. 架构设计成熟

  • 完全离线能力:核心功能零网络依赖,符合高安全环境部署
  • 分层加载机制:内存敏感场景可仅加载CRITICAL/HIGH层级
  • LRU缓存:消息哈希缓存实现90%性能节省
  • 输入/输出双向扫描:既防输入注入,也防输出数据泄露

3. 生态与合规

  • SHIELD标准格式输出,便于SIEM集成
  • GDPR/CCPA合规:威胁上报采用SHA-256匿名指纹,绝不传输原始内容
  • MIT许可证,商业友好

潜在局限

1. 默认网络行为

  • 外部API默认启用,虽为PULL-ONLY模式且支持优雅降级,但可能不符合某些强制离线策略
  • 建议高安全场景显式设置PG_API_ENABLED=false

2. 正则引擎风险

  • 577+正则模式存在理论ReDoS风险,虽有限长保护(50KB)和错误处理,但无硬超时机制
  • 复杂混淆输入可能消耗较高CPU

3. 多语言检测依赖

  • 可选依赖langdetect维护状态陈旧,长期兼容性存疑

4. 误报管理

  • "paranoid"敏感度级别下,创意写作、技术讨论等场景可能出现过度拦截

适合人群

  • AI应用开发者:为Chatbot、Agent系统快速增加输入过滤层
  • 企业安全团队:需符合合规要求的LLM网关防护
  • 红队/安全研究员:理解提示攻击模式,构建防御基线
  • MCP/插件生态建设者:SHIELD格式便于跨平台威胁情报共享

常规风险

| 风险场景 | 说明 | 缓解建议 |
|---------|------|---------|
| API服务器入侵 | 恶意模式注入(虽有多层校验) | 离线模式运行,或校验模式SHA-256 |
| 缓存交叉污染 | 多租户环境下哈希缓存泄露检测历史 | 禁用缓存或严格隔离实例 |
| 日志敏感信息 | JSONL日志可能含检测上下文 | 配置安全日志路径,实施轮转策略 |
| 依赖供应链 | langdetect等可选依赖CVE | 定期`pip-audit`扫描,最小化依赖安装 |

安全评分:A级(78分),CLS-Certify认证通过,静态分析82分,依赖审计90分,隐私合规85分。

Prompt Guard 内容

blog文件夹
patterns文件夹
prompt_guard文件夹
scripts文件夹
tests文件夹
手动下载zip · 179.9 kB
how-i-secured-my-ai-agent.mdtext/markdown
请选择文件