Openclaw Plugin

🛡️ AI Agent 实时入侵检测与隔离

AI 代理推理式入侵检测系统,支持隔离阻断与人工审核,防止提示词注入与恶意指令执行。

收藏
11.2k
安装
3.1k
版本
1.3.2
CLS 安全性认证2026-07-14
点击查看完整报告 >

使用说明

核心用法

hopeIDS 是一款面向 AI Agent 生态的推理型入侵检测系统(IDS),通过实时扫描入站消息识别潜在威胁。系统采用三级处置策略:ALLOW(正常放行)、WARN(注入安全警告后继续处理)、BLOCK(严格模式下完全阻断)。配置层面支持全局默认策略与精细化按代理(per-agent)覆盖,可针对不同业务场景(如公开扫描器 vs 核心主代理)设定差异化风险阈值。

关键工作流:Message → autoScan() → 风险评分 → 决策分支。阻断时生成仅含元数据的隔离记录,并通过 Telegram Bot 向管理员推送可操作的审核告警(/approve/reject/trust 命令),实现最小权限原则下的人工介入。

显著优点

1. 零内容残留设计:阻断消息不进入代理记忆系统(jasper-recall),隔离记录剔除原始内容,仅保存哈希与模式匹配摘要,降低数据泄露与对抗样本复现风险。
2. 人机协同闭环:Telegram 告警基于结构化元数据拼接,无 LLM 参与生成,避免告警链路本身成为攻击面;审核命令影响未来行为,不复活已阻断消息,语义清晰。

3. 弹性策略架构:支持 strictMode 开关、0-1 连续风险阈值、按代理独立配置,兼顾高敏感场景的偏执防御与常规场景的可用性平衡。

潜在局限

  • 检测能力边界:依赖正则与关键词模式匹配(如 ignore.*instructions),对语义变形、编码绕过、多模态隐写等高级对抗样本覆盖有限,尚未披露是否集成 LLM-as-Judge 或 embedding 相似度检测。
  • 运维复杂度:Telegram Chat ID、风险阈值、代理映射需手动维护 JSON 配置,缺乏可视化策略编排界面;trustOwners 等白名单机制若配置不当易引入特权绕过。
  • 生态锁定:与 OpenClaw 框架深度耦合,独立部署或迁移至其他 Agent 平台需适配成本。

适合人群

  • 运营多租户/多角色 AI Agent 的中高阶开发者
  • 对提示词安全(Prompt Security)有合规要求的 B2B SaaS 团队
  • 已采用 OpenClaw 生态并需要开箱即用隔离方案的技术组织

常规风险

| 风险类别 | 说明 |
|---------|------|
| 误报导致业务中断 | 高敏感阈值下正常指令被阻断,需建立 `/approve` 快速申诉与再教育流程 |
| 审核延迟 DoS | Telegram 告警依赖外部 Bot 链路,网络抖动或速率限制可能导致阻断消息堆积 |
| 配置漂移 | 多代理阈值分散在 JSON 中,版本迭代时易出现策略不一致 |
| 元数据推断攻击 | 隔离记录虽无原始内容,但 `patterns` 与 `intent` 标签可能泄露系统检测规则,需限制记录访问权限 |

安全解读

核心功能

hopeIDS 是专为 OpenClaw AI 代理框架设计的安全扫描插件,采用推理驱动的入侵检测机制,在消息到达代理前执行多层威胁分析。其核心架构遵循四个安全不变量:阻断即完全中止、仅存储元数据、批准不重新注入、警报完全程序化。

显著优点

安全设计严谨:采用元数据隔离架构,被阻断消息仅存储内容哈希、风险评分、匹配模式等元数据,绝不保留原始恶意内容,从源头杜绝敏感信息泄露。支持灵活的 per-agent 配置,可为不同安全等级的代理设置差异化的风险阈值(0.6-0.8)和处置模式(严格阻断/警告放行)。

检测机制多层:结合启发式规则扫描与语义分析,可识别命令注入、凭证窃取、提示注入越狱、数据外泄、身份冒充等六类威胁。内置人工审核循环(Human-in-the-loop),通过 Telegram Bot 发送结构化警报,支持 /approve/reject/trust 等交互命令实现安全运营。

运营体验良好:Telegram 警报基于元数据程序化构建,无 LLM 参与降低攻击面;支持自动扫描与手动扫描双模式;隔离区记录支持过期清理和状态追踪。

潜在局限性

外部依赖信任链:核心检测引擎依赖 hopeid npm 包(^0.1.0),该包代码未完全开源审计,需建立信任链。AGPL-3.0 许可证对商业使用有传染性要求。

语义分析数据出境:启用语义分析时,消息内容需发送至用户配置的 LLM 端点(OpenAI/Claude/本地模型等),虽已在文档充分披露,但处理敏感场景时需谨慎评估。

无消息复活机制:设计哲学上阻断消息不可恢复,误拦需发送方重新发送,对实时性要求高的场景可能有体验损失。

适合人群

  • 部署 AI 代理至生产环境、需防范提示注入/越狱攻击的开发者
  • 处理半开放输入源(邮件、社交媒体、Webhook)的自动化工作流
  • 有安全运营人员可响应 Telegram 警报的中大型团队
  • 对数据隐私敏感、要求元数据隔离存储的合规场景

常规风险

  • 配置风险strictMode 误设为 false 可能让高危威胁以警告形式放行
  • 阈值风险:风险阈值设置过低导致误报泛滥,或过高导致漏检
  • LLM 端点风险:配置不可信 LLM 服务可能导致数据泄露或分析结果被污染
  • 依赖风险hopeid 包更新引入breaking change或安全漏洞

Openclaw Plugin 内容

手动下载zip · 14.1 kB
index.tstext/plain
请选择文件