Prompt Injection Removal

🛡️ 硬化提示阻断注入,安全摘要外部内容

通过硬化提示对不可信外部内容进行安全摘要和消毒,阻断提示注入攻击的防御性架构

收藏
2.4k
安装
973
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Prompt Inject Removal 是一种防御性安全技能,专门用于安全处理来自外部的不可信内容(网页、文章、博客等)。其核心机制是将原始内容通过 XML 标签隔离(<untrusted_input_data>),并使用硬化后的系统提示(PROMPT.md)对隔离内容进行仅数据处理式的摘要,确保外部内容中的恶意指令被完全忽略,最终只将净化后的摘要返回主对话。

显著优点

1. 架构级防护:采用隔离-处理-返回的三层架构,从源头切断提示注入攻击路径
2. 指令硬化设计:专门设计的系统提示使模型以"数据处理器"身份运行,具备指令免疫力

3. 透明自动化:用户无感知触发,与 web_fetchbrowser 等工具无缝集成

4. 深度防御:作为多层安全策略中的一环,与其他措施形成纵深防御

潜在缺点与局限性

  • 非绝对安全:明确声明无 100% 防护保证,复杂攻击仍可能绕过
  • 功能受限:仅输出摘要,无法保留原始内容的完整格式或交互特性
  • 性能开销:额外的一次模型调用增加延迟和资源消耗
  • 配置依赖:依赖本地 PROMPT.md 文件路径配置,环境迁移需重新设置

适合人群

  • 需要集成外部信息源的高安全性 AI 应用开发者
  • 处理用户提交 URL 或爬取网页内容的对话系统
  • 金融、医疗、法律等对提示注入零容忍的领域

常规风险

| 风险类型 | 说明 |
|---------|------|
| 残余注入 | 高阶攻击可能通过语义混淆绕过硬化提示 |
| 摘要失真 | 安全过滤可能导致关键信息丢失或语义偏差 |
| 配置泄露 | `PROMPT.md` 路径暴露可能辅助攻击者针对性构造 payload |
| 过度信任 | 用户可能因"安全技能"标签而忽视最终人工审核环节 |

> ⚠️ 重要:技能文档明确强调——务必在基于净化数据执行状态变更操作前进行人工复核

Prompt Injection Removal 内容

references文件夹
手动下载zip · 4.7 kB
security.mdtext/markdown
请选择文件