核心用法
Prompt Guard 是一款专为大语言模型(LLM)系统设计的输入安全过滤工具,通过正则表达式模式匹配检测六类提示注入攻击:指令覆盖(injection)、越狱绕过(jailbreak)、数据外泄(exfiltration)、权限提升(escalation)、隐藏指令操纵(manipulation)以及复合攻击(compound)。支持通过命令行、Python API 或 JSON 接口调用,提供三级风险判定(clean/blocked/suspicious)和文本消毒输出。
显著优点
- 场景化风险加权:针对邮件、Discord、网页抓取等不同来源自动应用 1.0x–1.5x 的严格度乘数,高威胁源(web/untrusted)触发更严格的拦截阈值
- 多层防御架构:支持独立扫描、三明治防御(sandwich defense)嵌入系统提示,以及 API 请求前置过滤
- 低延迟设计:纯正则匹配方案,无需调用云端模型,适合实时流式处理
- 可扩展规则:开源模式定义格式
(regex, severity, description),便于社区贡献新攻击特征
潜在缺点与局限性
- 正则匹配的固有边界:仅能识别已知攻击模式,无法防御语义层面的新型越狱攻击或对抗性扰动
- 误报风险:安全研究、技术文档讨论可能触发关键词过滤;缺乏 ML 分类器导致模糊案例难以区分
- 多模态盲区:明确不覆盖图像/音频等多模态注入攻击
- 无深度语义分析:无法理解上下文意图,对精心构造的同义改写可能失效
适合人群
- 构建多智能体系统(The Reef、AutoGPT 等)的开发者
- 处理外部不可信输入(邮件、网页、社交媒体消息)的 LLM 应用架构师
- 需要符合 SOC 2/ISO 27001 输入验证审计要求的企业安全团队
常规风险
- 过度依赖风险:单一依赖此工具可能导致防御盲点,需结合输出过滤、人类监督形成纵深防御
- 规则维护负担:攻击模式持续演进,需建立内部威胁情报更新流程
- 供应链安全:
filter.py脚本本身的完整性验证机制未在文档中体现