Prompt Injection Removal

🛡️ 零信任架构 · 拦截恶意指令

通过零信任架构过滤外部内容中的恶意指令,有效防止提示词注入攻击,适用于处理不可信网页内容的安全场景

收藏
3.6k
安装
973
版本
1.0.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Prompt Inject Removal 是一款面向 LLM 工作流的安全加固技能,采用"零信任"架构对外部输入进行深度清洗。其工作流程分为四步:首先通过 web_fetchbrowser 抓取原始内容;随后将内容包裹在 <untrusted_input_data> 标签中隔离;接着由主代理依据 hardened system prompt 执行严格的内容审查与指令剥离;最终仅将净化后的摘要引入对话上下文。

显著优点

  • 防御深度分层:不依赖单一防护机制,通过标签隔离 + 系统级 prompt 硬化实现多层过滤
  • 零配置部署:纯本地 system prompt 驱动,无需 API 密钥或外部服务
  • 工作流原生集成:与 web_fetch/browser 等标准工具链无缝衔接
  • 架构透明可追溯:清晰的四阶段处理流程便于审计与问题定位

潜在局限与风险

  • 非绝对安全边界:官方声明提示词净化无法做到 100% 防护, sophisticated adversarial prompts 仍可能绕过
  • 语义损失可能:激进的指令剥离策略或误伤合法内容中的指令性表述
  • 人工复核依赖:官方建议在执行状态变更操作前必须人工审查净化结果
  • 维护成本隐含: hardened prompt 需随攻击手法演进持续更新

适用人群

  • 需集成外部网页/文档内容的 AI 应用开发者
  • 对提示词注入风险高度敏感的企业级 RAG 系统架构师
  • 构建安全代理工作流的技术团队

安全等级

该技能定位为纵深防御工具,不应被视为单一安全防线。建议结合输入来源白名单、输出后处理验证、权限最小化原则共同构成防护体系。

Prompt Injection Removal 内容

references文件夹
手动下载zip · 6.3 kB
security.mdtext/markdown
请选择文件