Reef Prompt Guard

🛡️ LLM提示注入实时防御过滤器

实时检测LLM提示注入攻击的防御工具,支持多场景输入过滤,采用风险加权评分机制,可拦截指令覆盖、越狱和数据窃取等威胁。

收藏
3.1k
安装
1.5k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Prompt Guard 是一款专为大语言模型(LLM)系统设计的输入安全过滤工具,通过正则表达式模式匹配检测六类提示注入攻击:指令覆盖(injection)、越狱绕过(jailbreak)、数据外泄(exfiltration)、权限提升(escalation)、隐藏指令操纵(manipulation)以及复合攻击(compound)。支持通过命令行、Python API 或 JSON 接口调用,提供三级风险判定(clean/blocked/suspicious)和文本消毒输出。

显著优点

  • 场景化风险加权:针对邮件、Discord、网页抓取等不同来源自动应用 1.0x–1.5x 的严格度乘数,高威胁源(web/untrusted)触发更严格的拦截阈值
  • 多层防御架构:支持独立扫描、三明治防御(sandwich defense)嵌入系统提示,以及 API 请求前置过滤
  • 低延迟设计:纯正则匹配方案,无需调用云端模型,适合实时流式处理
  • 可扩展规则:开源模式定义格式 (regex, severity, description),便于社区贡献新攻击特征

潜在缺点与局限性

  • 正则匹配的固有边界:仅能识别已知攻击模式,无法防御语义层面的新型越狱攻击或对抗性扰动
  • 误报风险:安全研究、技术文档讨论可能触发关键词过滤;缺乏 ML 分类器导致模糊案例难以区分
  • 多模态盲区:明确不覆盖图像/音频等多模态注入攻击
  • 无深度语义分析:无法理解上下文意图,对精心构造的同义改写可能失效

适合人群

  • 构建多智能体系统(The Reef、AutoGPT 等)的开发者
  • 处理外部不可信输入(邮件、网页、社交媒体消息)的 LLM 应用架构师
  • 需要符合 SOC 2/ISO 27001 输入验证审计要求的企业安全团队

常规风险

  • 过度依赖风险:单一依赖此工具可能导致防御盲点,需结合输出过滤、人类监督形成纵深防御
  • 规则维护负担:攻击模式持续演进,需建立内部威胁情报更新流程
  • 供应链安全filter.py 脚本本身的完整性验证机制未在文档中体现

Reef Prompt Guard 内容

references文件夹
scripts文件夹
手动下载zip · 16.1 kB
attack-patterns.mdtext/markdown
请选择文件