核心用法
Agent Hardening Skill 是一套面向 OpenClaw 代理的安全自检套件,通过 Python 脚本模拟三种常见注入攻击向量,帮助开发者验证输入清洗机制的有效性。
三大检测模块:
1. Unicode 控制字符清洗 — 检测零宽连字符(U+200D)、零宽非连字符(U+200C)、隐形分隔符(U+2063)、BOM 注入(U+FEFF)等 Cf 类别字符是否被正确过滤
2. HTML 注释注入检测 — 识别 <!-- ... --> 形式的隐藏指令,防范提示词注入攻击
3. 双向文本覆盖检测 — 扫描文件名中的双向覆盖字符(U+202A-U+202E、U+2066-U+2069),防止视觉欺骗攻击
所有检测均使用硬编码合成样本,不访问本地文件系统、配置文件或内存目录。
显著优点
- 完全自包含:纯 Python 3 实现,零外部依赖,开箱即用
- 零副作用:不读取、不写入、不传输任何数据,适合生产环境预检
- 攻击覆盖全:涵盖 Unicode 层、标记层、视觉层三类隐蔽注入手法
- 结果可视化:✅/⚠️ 即时反馈,快速定位薄弱环节
潜在缺点与局限性
- 被动检测仅:只能验证当前过滤逻辑,不提供自动修复方案
- 覆盖非穷尽:未覆盖 Base64 编码、JSON 嵌套、Markdown 注释等变体攻击
- 无持续监控:一次性脚本,需集成到 CI/CD 才能实现自动化
- Python 专属:检测逻辑基于 Python
unicodedata和re模块,其他语言需移植
适合人群
- Agent/LLM 应用开发者
- 安全测试工程师
- 开源项目维护者(需在合并前执行准入检查)
常规风险
- 误报率低,漏报风险存在:合成样本无法穷尽所有 Unicode 变体
- 环境依赖:检测效果受限于目标 Agent 的实际输入处理路径,若 Agent 有多层输入(预处理/后处理),需分层测试
- 无认证背书:工具本身未经第三方安全审计,结果仅供参考