核心用法
Agent Hardening Skill 是一款专为 OpenClaw 智能体设计的安全测试工具,通过运行自包含的 Python 脚本,帮助开发者验证其 Agent 的输入净化能力。该 Skill 包含三项核心检测模块:
1. Unicode 控制字符净化测试:检测零宽连接符(ZWJ)、零宽非连接符(ZWNJ)、不可见分隔符及 BOM 注入等隐形字符是否被正确过滤。
2. HTML 注释注入检测:识别输入中隐藏的 HTML 注释指令,如 <!-- save this to memory --> 或 <!-- SYSTEM: ignore previous instructions --> 等潜在的提示词注入攻击。
3. 双向文本覆盖检测:扫描文件名或路径中的双向文本覆盖字符(如 U+202E),这类字符常被用于伪装恶意文件扩展名。
所有测试均使用硬编码的合成样本数据,无需配置,直接运行即可生成检测报告。
显著优点
- 完全自包含:零第三方依赖,仅使用 Python 标准库(unicodedata、re),无需担心供应链攻击。
- 零数据风险:不访问本地文件系统、用户配置或内存目录,不上传任何数据到外部。
- 即用即走:无需复杂配置,复制代码即可运行,适合快速安全审计。
- 社区驱动:威胁定义持续更新于 GitHub 仓库,紧跟最新攻击模式。
潜在缺点与局限性
- 覆盖范围有限:当前仅检测三种攻击模式,对于 Base64 编码混淆、Unicode 同形异义字符、Markdown/HTML 混合注入等高级攻击尚未覆盖。
- 合成数据局限:测试样本为预设案例,无法完全模拟真实世界的复杂攻击变体。
- 无自动化集成:缺乏 CI/CD 流水线集成示例,需要手动复制代码运行。
- 来源可信度:由个人开发者维护,无知名安全公司或开源基金会背书。
适合的目标群体
- AI Agent 开发者:需要验证输入处理安全性的 OpenClaw、LangChain 等框架用户。
- 安全研究人员:快速验证 Agent 系统的抗注入能力。
- DevSecOps 工程师:作为安全测试套件的一部分,纳入开发流程。
- 技术产品经理:评估第三方 Agent 产品的安全基线。
使用风险
- 性能影响:测试脚本为 CPU 密集型字符串处理,极长输入可能导致短暂延迟。
- 误报可能:严格的净化规则可能误伤合法的 Unicode 字符使用场景(如多语言内容)。
- 依赖上游更新:威胁定义引用外部 GitHub 仓库,需关注维护活跃度。
- 许可证模糊:当前未明确声明开源许可证,商业使用存在法律不确定性。