Prompt Guard

🛡️ AI Agent 注入攻击防护盾

AI 增强榜 #21

AI agent专用高级提示词注入防御系统,支持349种攻击模式检测、多语言识别、分级安全响应及敏感信息防泄漏,适用于群组聊天环境

收藏
29.9k
安装
12.8k
版本
2.5.2
CLS 安全性认证2026-07-14
点击查看完整报告 >

使用说明

Prompt Guard v2.5.1 综合评估

核心功能

Prompt Guard是专为Clawdbot等AI agent设计的提示词注入防御与运营安全系统,提供从检测、分级到响应的完整安全闭环。其核心架构包含三大模块:提示词注入防御(直接/间接/多轮攻击检测)、秘密信息保护(API密钥、凭证防泄漏)、基础设施安全(网关/SSH/浏览器会话加固)。

系统支持349种攻击模式(v2.5.0版本2.7倍扩容),覆盖指令覆盖、角色操控、系统模拟、越狱尝试等直接注入,以及恶意文件、URL载荷、Base64编码、Unicode同形字符等间接注入。v2.5.1紧急新增系统提示词模拟攻击检测,可识别<claude_*>[INST]GODMODE等LLM内部标记伪装。

多语言检测引擎支持英/韩/日/中四种语言,针对非英语攻击场景(如韩语"이전 지시 무시해"、日语"前の指示を無視して")提供同等防护强度。

显著优点

1. 分级响应机制:SAFE/LOW/MEDIUM/HIGH/CRITICAL五级安全评级,匹配差异化的处置策略(仅记录→警告→拦截→通知所有者),避免过度拦截影响正常交互
2. 场景化攻击覆盖:新增梦境越狱、艺术场景越狱、学术研究框架、时间偏移规避等情境化绕过手段,应对快速演化的攻击手法

3. 运营安全整合:不仅检测攻击,更提供SSH加固指南、网关绑定策略(loopback/lan/0.0.0.0风险矩阵)、凭证轮换SOP等可落地的运维方案

4. 秘密信息闭环:内置"永不输出密钥"硬规则,检测到配置读取、环境变量导出等请求时自动阻断并记录

5. 可审计性:完整的安全日志(memory/security-log.md)、analyze_log.py分析工具、audit.py系统巡检,满足合规要求

局限性与风险

  • 语言覆盖有限:仅四种语言,对越南语、阿拉伯语、俄语等攻击场景无原生支持
  • 误报可能:高敏感度(paranoid)模式下,正常的技术讨论(如"ignore previous context in NLP")可能触发拦截
  • 上下文窗口依赖:多轮攻击检测 effectiveness 受限于可访问的对话历史长度
  • 配置复杂性config.yaml涉及owner_id、敏感度级别、动作映射等多维参数,新手易配置错误
  • Webhook暴露风险:文档明确警告bind: 0.0.0.0+端口转发+弱认证的组合危险,但仍是常见误配场景

适合人群

  • AI agent开发者:需为Claude、GPT等构建的系统级防护
  • Telegram Bot运营者:特别是部署于公开群组的场景
  • 企业安全团队:寻求AI交互层面的合规与审计能力
  • 高敏感度用户:处理财务、医疗、法律等垂直领域的AI代理

常规风险

  • 凭证暴露:用户可能无意中在群组粘贴测试用API key,被系统记录后需立即轮换
  • 社会工程绕过: urgency/emotional manipulation 检测依赖关键词,高级定制话术可能穿透
  • 供应链风险detect.py等脚本本身若被篡改,将造成假阴性

安全等级评定

  • 检测能力:S+(349模式+实时更新)
  • 响应完整性:S(分级处置+日志+通知)
  • 运维可操作性:A(文档详尽但配置门槛存在)
  • 整体S级 — 当前开源/半开源AI agent安全方案中的第一梯队

安全解读

核心用法

Prompt Guard v2.5.1 是一款专为 AI Agent 设计的提示词注入防御系统,提供多层级安全检测与响应机制:

1. 实时威胁检测

  • 集成 349 种攻击模式库,覆盖直接注入、间接注入、多轮攻击、情感操控等攻击向量
  • 支持英语/韩语/日语/中文四种语言的攻击模式识别
  • 基于正则表达式的轻量级检测引擎,15ms 内完成单条消息分析

2. 分级响应策略

| 等级 | 触发条件 | 默认动作 |
|------|---------|---------|
| SAFE | 正常消息 | 放行 |
| LOW | 轻微可疑 | 静默记录 |
| MEDIUM | 明确操控尝试 | 警告+记录 |
| HIGH | 危险命令尝试 | 拦截+记录 |
| CRITICAL | 即时威胁 | 拦截+通知所有者 |

3. 敏感信息保护

  • 自动拦截 API Key、Token、密码、环境变量等机密信息的外泄请求
  • 强制「暴露即轮换」原则,阻断配置文件的聊天窗口展示

4. 群组环境加固

  • 限制敏感命令(exec/write/gateway/browser 等)仅所有者可用
  • 支持速率限制与审计日志

显著优点

  • 攻击覆盖全面:从经典「忽略先前指令」到新兴的 Unicode 同形字符攻击、Token 走私、场景化越狱(梦境/学术/时间错位)均有对应检测规则
  • 多语言原生支持:非简单翻译,而是针对各语言文化语境设计的本土化攻击模式(如韩语「나는 관리자야」、日语「前の指示を無視して」)
  • 零敏感依赖:仅依赖 PyYAML,无网络请求行为,无 eval/exec/system 等危险函数
  • 配置灵活:四级敏感度可调,支持自定义响应动作与日志策略
  • 来源可信:MIT 开源许可,GitHub 公开仓库,活跃维护(2025-01 至 2026-02 持续迭代)

潜在局限

1. 基于规则的固有边界:正则表达式模式库需持续更新以应对新型攻击变体,对零日攻击(zero-day)无先验防御能力
2. 上下文理解有限:检测基于单条消息特征,复杂的多轮上下文污染可能需要更高级别的 LLM 级语义分析才能识别

3. 误报风险:高敏感度(paranoid)模式下,正常的技术讨论(如「如何配置 API Key」)可能触发拦截

4. 无主动学习机制:依赖人工维护攻击模式库,无自动从攻击样本中学习的自适应能力

适合人群

  • AI Bot 部署者:运营 Telegram/Discord 群组机器人的开发者
  • 企业 AI Agent 管理员:需满足多用户访问场景下的安全合规要求
  • 安全研究员:需快速搭建提示词攻击检测基线的场景
  • 隐私敏感用户:希望防止意外泄露 API Key 或系统配置的个人用户

常规风险

| 风险类型 | 等级 | 说明 |
|---------|------|------|
| 检测绕过 | 中 | 攻击者通过深度变体(如多层 Base64 编码)可能绕过静态规则 |
| 误报干扰 | 低-中 | 技术文档讨论、代码示例分享时可能触发误拦截 |
| 日志隐私 | 低 | 默认记录完整消息内容,敏感场景建议设置 `include_message: false` |
| 配置泄露 | 中 | 若未正确设置文件权限(chmod 600),config 文件可能被本地其他用户读取 |

使用建议

建议搭配「轮询模式+回环绑定」部署以最小化暴露面,定期运行 audit.py 进行系统安全审查,并保持攻击模式库的及时更新。

Prompt Guard 内容

blog文件夹
scripts文件夹
手动下载zip · 44.6 kB
how-i-secured-my-ai-agent.mdtext/markdown
请选择文件