Anti-Injection-Skill

🛡️ AI Agent多层安全防御中枢

security榜 #9

企业级AI安全防御系统,覆盖99.2%已知攻击向量,含专家级越狱技术防护与动态评分机制。

收藏
43.1k
安装
9.6k
版本
2.0.0
CLS 安全性认证2026-07-01
点击查看完整报告 >

使用说明

核心功能

Security Sentinel 是一套面向自主AI Agent的多层安全防御体系,采用预防-检测-响应三位一体的架构设计。核心能力覆盖三大类威胁场景:

1. 经典攻击防御:指令覆盖、系统提示提取、多语言混淆、间接注入、RAG投毒、凭证窃取等15+攻击类别
2. 高级持续性威胁:内存驻留攻击(spAIware)、时序触发器、权限渐进提升、行为模式操控

3. 专家级越狱技术:角色扮演(45%成功率)、情感操控、语义改写、渐进式升级Crescendo(71%)、自动化PAIR攻击(84%)

技术架构亮点

四层检测引擎

  • 精确模式匹配(947+核心模式)
  • 语义意图分类(7类阻断意图,0.78余弦相似度阈值)
  • 多语言逃逸识别(15+语言,3,200+模式)
  • 行为异常监测(对话历史分析,Crescendo/PAIR检测)

动态评分系统:100分基准,按事件扣减(-7至-20分),连续3次合法查询恢复15分。低于40分触发锁定模式,仅响应安全业务主题。

显著优势

  • 高覆盖度:99.2% documented threats,含2025-2026最新研究(Anthropic诗歌攻击、CMU PAIR等)
  • 低延迟:单次检测~50ms,可前置至所有工具调用
  • 可观测性:完整AUDIT.md审计日志,Telegram实时告警
  • 弹性恢复:误触后可通过正常交互快速恢复信任分数

潜在局限

  • 零日攻击:完全新颖的注入手法存在检测盲区
  • 上下文依赖:极短查询可能缺乏足够语义上下文
  • 误报风险:关于AI能力的正当元讨论可能触发阻断
  • 多轮隐蔽攻击:高度 subtle 的跨轮次操控可能逃逸

适用场景

  • 高价值自主Agent:财务操作、数据访问、代码执行等高风险工作流
  • 多租户SaaS平台:需隔离用户输入与系统提示的B2B服务
  • 合规敏感行业:金融、医疗、政务等需完整审计追踪的领域
  • 公开-facing Bot:Reddit、Discord、Telegram等不可信输入环境

风险提醒

1. 不可跳过"可信来源"的检测——内部账户同样可能成为攻击载体
2. 警告模式(60-79分)信号不可忽视,这是攻击探测的典型阶段

3. 工具输出同样需要消毒,RAG/搜索返回内容可能含间接注入payload

4. 月度模式更新为必需项,攻击技术演进速度极快(Crescendo到PAIR仅用6个月)

安全解读

Security Sentinel 综合评估

Security Sentinel 是一款专为自主AI Agent设计的多层安全防护技能,核心定位是前置安全网关——必须在所有业务逻辑之前执行。

核心用法

技能采用"三层检测+动态评分"架构:
1. 黑名单模式匹配(347+基础模式):识别经典注入指令如"ignore previous instructions"、系统提取请求、越狱尝试等

2. 语义相似度分析:通过意图分类检测语义改写攻击,阈值0.78,覆盖7类危险意图(meta_disclosure、system_extraction等)

3. 规避战术检测:识别多语言切换、音译、同形异义字符等15+语言变体

动态评分系统(100分制)根据检测结果实时调整安全等级:≥80分正常、60-79警告、40-59警报、<40锁定模式。锁定后仅响应安全业务查询,3次合法查询恢复15分。

显著优点

  • 威胁覆盖全面:V2.0版本整合947+核心攻击模式,涵盖传统注入、高级越狱(Crescendo 71%、PAIR 84%成功率攻击)、间接注入、RAG投毒、MCP漏洞、内存持久化攻击(spAIware)等
  • 实战验证:基于ClawHavoc真实攻击活动($2.4M损失、847个AWS账户沦陷)和578个Poe.com机器人测试数据
  • 零依赖架构:纯Markdown文档型技能,无第三方库,无外部API调用,12.5秒完整扫描
  • MIT许可证:开源可定制,支持社区威胁情报贡献

局限性与风险

  • 来源可信度T3:作者Georges Andronescu为个人开发者,GitHub仓库无法API验证(404),存在供应链验证成本
  • 零日攻击盲区:明确承认无法检测完全新颖的注入方法,依赖持续更新
  • 性能开销:单次检测约50ms,高频场景需优化
  • 误报可能: legitimate的AI元讨论可能触发语义检测,需人工反馈调优

适合人群

  • 部署自主AI Agent的企业/开发者(尤其使用MCP、RAG架构)
  • 处理敏感数据(AWS/GCP/Azure凭证、API密钥)的自动化工作流
  • 需要合规审计日志(AUDIT.md)的金融、医疗行业场景

常规风险

  • 安装脚本风险:install.sh从GitHub raw域名下载文件,建议沙盒环境运行或手动校验哈希
  • 多轮攻击逃逸:Crescendo等渐进式攻击可能单轮通过检测,需启用对话历史分析
  • 评分阈值僵化:固定阈值(0.78/0.65)可能不适应特定业务场景,建议根据AUDIT.md反馈自适应调整

部署建议

务必作为最高优先级执行链:用户输入→Security Sentinel→计划制定→工具执行。配合Telegram警报(<60分触发)和每周AUDIT.md审查,形成闭环安全运营。

Anti-Injection-Skill 内容

手动下载zip · 86.7 kB
advanced-jailbreak-techniques.mdtext/markdown
请选择文件