Agent Hardening

🛡️ Agent 注入攻击自检套件

安全自检工具,用合成数据检测Agent输入过滤漏洞,零文件访问、零依赖。

收藏
7.7k
安装
2.5k
版本
1.1.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Agent Hardening Skill 是一套面向 OpenClaw 代理的安全自检套件,通过 Python 脚本模拟三种常见注入攻击向量,帮助开发者验证输入清洗机制的有效性。

三大检测模块:
1. Unicode 控制字符清洗 — 检测零宽连字符(U+200D)、零宽非连字符(U+200C)、隐形分隔符(U+2063)、BOM 注入(U+FEFF)等 Cf 类别字符是否被正确过滤

2. HTML 注释注入检测 — 识别 <!-- ... --> 形式的隐藏指令,防范提示词注入攻击

3. 双向文本覆盖检测 — 扫描文件名中的双向覆盖字符(U+202A-U+202E、U+2066-U+2069),防止视觉欺骗攻击

所有检测均使用硬编码合成样本,不访问本地文件系统、配置文件或内存目录。

显著优点

  • 完全自包含:纯 Python 3 实现,零外部依赖,开箱即用
  • 零副作用:不读取、不写入、不传输任何数据,适合生产环境预检
  • 攻击覆盖全:涵盖 Unicode 层、标记层、视觉层三类隐蔽注入手法
  • 结果可视化:✅/⚠️ 即时反馈,快速定位薄弱环节

潜在缺点与局限性

  • 被动检测仅:只能验证当前过滤逻辑,不提供自动修复方案
  • 覆盖非穷尽:未覆盖 Base64 编码、JSON 嵌套、Markdown 注释等变体攻击
  • 无持续监控:一次性脚本,需集成到 CI/CD 才能实现自动化
  • Python 专属:检测逻辑基于 Python unicodedatare 模块,其他语言需移植

适合人群

  • Agent/LLM 应用开发者
  • 安全测试工程师
  • 开源项目维护者(需在合并前执行准入检查)

常规风险

  • 误报率低,漏报风险存在:合成样本无法穷尽所有 Unicode 变体
  • 环境依赖:检测效果受限于目标 Agent 的实际输入处理路径,若 Agent 有多层输入(预处理/后处理),需分层测试
  • 无认证背书:工具本身未经第三方安全审计,结果仅供参考

Agent Hardening 内容

手动下载zip · 1.7 kB
SKILL.mdtext/markdown
请选择文件