AOI Prompt Injection Sentinel

🛡️ 实时拦截提示词攻击,守护 AI 对话安全

轻量级提示词注入检测器,为AI对话系统提供实时安全评分与分级处置,零外部依赖、MIT开源。

收藏
6.1k
安装
1.3k
版本
0.1.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

AOI Prompt Injection Sentinel 是一款专为 AI 对话场景设计的轻量级安全检测工具。用户可通过 CLI 接口对输入文本进行实时分析,支持直接传参(--text)或标准输入流(--stdin)两种调用模式。工具输出结构化 JSON,包含三级关键信息:

1. 严重度评分(0–4 级量化风险)
2. 处置动作(allow/log/warn/block 四级响应)

3. 命中规则详情(reasons + matched rule ids,便于审计追踪)

该设计实现了"检测-评分-处置-审计"的完整闭环,可无缝嵌入对话网关、RAG 前置过滤或 Agent 输入层。

显著优点

  • 零外部依赖:纯本地运行,无 webhook、无出站调用,杜绝供应链攻击面
  • 确定性输出:规则引擎驱动,拒绝概率性判断,适合高合规场景
  • 透明可审计:每条阻断均有明确规则 ID 支撑,满足企业安全审计要求
  • 开源可信:MIT 许可证,源码可审,无商业锁定
  • 渐进式治理:发布流程包含 Security Gate 与可审计 changelog,违规更新触发分级限制(警告→暂停→归档)

潜在局限

  • 规则维护成本:基于特征规则的方案需持续更新以覆盖新型注入模式(如间接提示注入、多模态攻击)
  • 语义理解边界:对语义复杂、上下文依赖深的对抗样本可能存在漏检
  • 无主动学习:当前版本未集成模型微调或在线学习机制,依赖人工规则迭代
  • 单一语种优化:文档未明示多语言规则覆盖程度

适合人群

  • 部署本地 LLM 服务的企业运维团队
  • 构建 AI Agent 平台的开发者(需在输入层增加安全关卡)
  • 对数据隐私敏感、需完全离线运行的金融/医疗/政务场景
  • 安全研究人员(可基于开源规则库进行二次开发)

常规风险

| 风险类别 | 说明 |
|---------|------|
| 规则绕过 | 攻击者可能通过编码变换、分段注入等技术绕过静态规则 |
| 性能瓶颈 | 高频调用场景下需评估规则引擎的吞吐延迟 |
| 误杀业务 | 过度严格的规则可能阻断合法用户的复杂查询 |
| 版本漂移 | 未及时同步官方规则更新可能导致防护滞后 |

建议生产环境采用"检测+采样审计+灰度回滚"的组合策略,并建立内部红队测试机制。

AOI Prompt Injection Sentinel 内容

手动下载zip · 2.9 kB
package.jsonapplication/json
请选择文件