Input Guard

🛡️ 零依赖提示注入防御前置层

零依赖Python防御层,实时扫描外部文本中的提示注入攻击,16类威胁检测+4级灵敏度,强制拦截高危内容。

收藏
6.6k
安装
2.9k
版本
1.0.1
CLS 安全性认证2026-06-23
点击查看完整报告 >

使用说明

核心用法

input-guard 是面向 AI agent 的提示注入防御前置层,必须在处理任何外部不可信文本(网页、推文、API 响应等)之前执行扫描。通过纯 Python 实现,零外部依赖,支持 16 类攻击检测、4 级灵敏度(low/medium/high/paranoid)、多语言模式匹配及可选 LLM 二次语义分析。

标准工作流:获取外部内容 → pipe 至 scan.sh → 解析 JSON 输出 → SAFE/LOW 则继续处理,MEDIUM+ 则中断并告警 → 可选上报 MoltThreats 社区。

显著优点

1. 零部署成本:仅依赖 Python 3 标准库,无需 pip install,任何环境开箱即用
2. 多层防御架构:正则模式(<100ms)+ 可选 LLM 语义分析(2-5s),后者可捕获隐喻叙事、间接指令提取等绕过攻击

3. 工程化集成友好:exit code 0/1 设计便于 shell 脚本链式调用,JSON/quiet/alert 多输出模式适配自动化流水线

4. 社区威胁情报:MoltThreats 集成支持上报确认的注入样本,形成共享防御网络

5. 多语言覆盖:英/韩/日/中四语攻击模式库,应对全球化攻击面

潜在局限与风险

  • 正则误报/漏报:模式匹配对编码混淆(零宽字符、Base64 嵌套)存在固有盲区,high/paranoid 模式可能过度拦截合法内容
  • LLM 成本与延迟:启用 --llm 后单次扫描约 2,000 tokens,高频场景成本累积显著;LLM 本身也可能被对抗样本欺骗
  • 依赖外部 LLM 密钥:LLM 层需 OpenAI/Anthropic API,存在供应商锁定与数据出境合规考量
  • 无沙箱执行:仅做静态分析,不验证 payload 的实际代码执行效果

适合人群

  • 构建自动化 agent 工作流的开发者(尤其涉及 web_fetch、搜索聚合场景)
  • 运营公开 AI 服务、需防范提示注入导致的数据泄露或行为劫持的团队
  • 对零依赖工具有硬性要求的安全审计环境

常规风险

| 风险项 | 说明 |
|--------|------|
| 扫描遗漏 | 新型攻击变种可能未被模式库覆盖,建议结合 `--llm-auto` 作为兜底 |
| 敏感信息外泄 | 启用 LLM 扫描时,文本内容发送至第三方 API,需评估数据分级 |
| 告警疲劳 | paranoid 模式高频误报可能导致运营人员忽视真实威胁 |

安全解读

核心用法

input-guard 是一款防御性安全工具,用于扫描来自不可信来源(网页、推文、API 响应等)的文本,检测其中是否嵌入了针对 AI 代理的提示注入攻击。它必须在处理任何外部内容之前运行,作为安全防线。

检测能力

  • 16 类攻击模式:指令覆盖、角色操控、系统模拟、越狱攻击、数据泄露、危险命令等
  • 多语言支持:英语、韩语、日语、中文
  • 4 级敏感度:low/medium/high/paranoid
  • 可选 LLM 增强扫描:针对隐喻叙述、间接指令提取等规避性攻击

工作流程
1. 获取外部内容 → 2. 运行 input-guard 扫描 → 3. 检查严重级别 → 4. SAFE/LOW 正常处理,MEDIUM+ 阻断并告警

输出模式

  • 人类可读(默认)、JSON(程序化)、Quiet(仅严重级别+分数)
  • 退出码:0 表示安全,1 表示检测到威胁

显著优点

  • 零依赖设计:纯 Python 标准库实现,无需 pip install,任何地方可运行
  • 双层检测:正则模式 + 可选 LLM 语义分析,兼顾速度与深度
  • 透明可控:所有外部 API 调用(OpenAI/Anthropic/MoltThreats)均需用户显式配置 API 密钥,无静默数据外传
  • 社区联动:可选集成 MoltThreats,报告威胁至社区数据库
  • 来源可信:基于知名开源项目 prompt-guard 改编,代码结构清晰,无混淆

潜在局限

  • LLM 模式成本:每次扫描约 2000 tokens,延迟 2-5 秒,不适合高频批量场景
  • 误报可能:high/paranoid 敏感度可能标记正常内容
  • 语言覆盖有限:仅支持四种语言,其他语种攻击可能漏检
  • 依赖环境变量:告警和 LLM 功能需正确配置环境变量

适合人群

  • 使用 AI 代理自动抓取、处理网页或社交媒体内容的用户
  • 需要集成第三方 API 响应到 AI 工作流的开发者
  • 对提示注入安全有要求的企业或研究团队
  • 希望建立输入验证层的 AI 应用架构师

常规风险

1. API 密钥泄露风险:若启用 LLM 模式,需妥善保管 OPENAI_API_KEY/ANTHROPIC_API_KEY
2. 依赖项风险:requests 库(可选依赖)需定期更新

3. subprocess 调用:告警功能调用 openclaw CLI,需确保该工具来源可信

4. 时效性局限:离线模式依赖内置 taxonomy,建议定期更新以获取最新威胁情报

Input Guard 内容

evals文件夹
scripts文件夹
手动下载zip · 44.7 kB
cases.jsonapplication/json
请选择文件