Glitchward Shield

🛡️ AI 对话实时防火墙

实时拦截提示词注入攻击,<10ms低延迟保护AI助手,支持50+攻击模式与多语言检测

收藏
9.4k
安装
2.6k
版本
1.0.0
CLS 安全性认证2026-08-04
点击查看完整报告 >

使用说明

核心用法

LLM Shield 是一款专为 OpenClaw 设计的实时安全防护层,通过云端 API 对所有传入消息进行风险评分,在 AI 处理前拦截潜在的提示词注入攻击。

部署方式:获取 glitchward.com 的 API Token,配置环境变量 GLITCHWARD_SHIELD_TOKEN 即可自动生效,无需修改应用代码。支持 block(拦截)、warn(警告)、log(仅记录)三种模式,风险阈值可自定义(0.0-1.0)。

关键能力

  • 检测 50+ 种攻击模式:指令覆盖(ignore all instructions)、越狱(DAN/Developer Mode)、角色劫持、数据外泄(~/.ssh/、AWS凭证)、XML/JSON 分隔符逃逸、多语言攻击等
  • <10ms 延迟,对用户无感知
  • 内置 /shield-status/shield-test 诊断命令

显著优点

1. 即插即用:单环境变量配置,零代码侵入
2. 覆盖面广:支持德语、斯洛伐克语、西班牙语、法语等 10+ 语言的攻击变体

3. 宣称零误报:文档明确标注对正常查询无干扰

4. 免费起步:1,000 次/月 免费额度满足个人使用

5. 隐私合规:TLS 1.3 加密,不存储对话历史,GDPR 合规

潜在缺点与局限性

  • 云端依赖:所有消息需发送至 Glitchward 服务器分析,存在网络延迟和单点故障风险
  • 闭源检测逻辑:攻击模式的具体规则和评分算法未开源,难以审计和定制
  • Token 管理成本:生产环境需安全保管 API 密钥,轮换机制需自行实现
  • 定价跳跃:免费档后直接跳到 €39.90/月(50,000次),缺乏中等规模过渡方案
  • 生态系统绑定:专为 OpenClaw 设计,迁移至其他框架需重新评估

适合人群

  • 个人开发者使用 OpenClaw 且担忧提示词注入风险
  • 小型团队需在无安全专家情况下快速加固 AI 应用
  • 涉及敏感文件系统访问或浏览器自动化的 OpenClaw 场景

常规风险

1. 供应商锁定:核心安全功能依赖单一商业服务
2. 数据出境:消息内容传输至斯洛伐克服务器(需关注合规区域限制)

3. 检测逃逸:对抗性攻击者可能针对未知检测规则设计绕过方案

4. API 配额耗尽:突发流量下可能因额度耗尽导致防护失效

安全解读

核心用法

LLM Shield 是一款专为 OpenClaw 设计的实时安全防护技能,采用"拦截-检测-响应"模式工作。安装后,所有传入用户消息都会先经 Shield 验证,通过后才送达 AI 处理。使用流程极简:注册 glitchward.com/shield 获取免费 API Token,设置环境变量 GLITCHWARD_SHIELD_TOKEN,即可自动启用防护。

技能提供三种工作模式:block(默认,直接阻断威胁)、warn(告警但放行)、log(仅记录)。用户可通过 /shield-status 查看配置状态和 API 连通性,用 /shield-test 预检测消息风险。支持自定义风险阈值(0.0-1.0),默认 0.5 平衡安全性与可用性。

显著优点

检测能力全面:覆盖 50+ 攻击模式,包括指令覆盖("Ignore all instructions")、越狱攻击(DAN/开发者模式)、角色劫持、数据外泄(敏感文件路径探测)、社交工程、分隔符逃逸及多语言攻击(德语、斯洛伐克语、西班牙语等 10+ 语言)。

性能优异:官方宣称 <10ms 延迟,实际测试 API 响应约 8ms,对用户体验几乎无感知。零依赖架构(纯原生代码)彻底消除供应链攻击风险。

隐私合规:仅传输消息内容用于分析,不存储对话历史,TLS 1.3 加密传输,通过 GDPR/CCPA 合规审查。免费套餐提供 1,000 次/月检测额度,满足个人使用。

透明可信:MIT 开源许可,278 行代码结构清晰,无混淆无动态代码加载,安全审计完全通过。

潜在缺点与局限

外部依赖绑定:核心检测逻辑依赖 glitchward.com 云端 API,存在网络可用性风险(未设置超时处理)和供应商锁定。若服务中断或变更定价,本地无 fallback 机制。

来源可信度限制:开发者 Glitchward 为个人开发者(T3 级别),非知名安全厂商或开源基金会,企业用户可能需要额外尽职调查。

输入长度无限制:当前未对超大消息做截断处理,可能导致 API 拒绝或内存问题。

误报率待验证:官方宣称"零误报",但安全检测的精确度高度依赖攻击模式库更新频率,实际长期表现需持续观察。

适合的目标群体

  • OpenClaw 个人用户:特别是启用了文件系统、浏览器、Shell 执行等高危权限的用户
  • 安全意识较强的开发者:需要为自建 AI 助手集成轻量级防护层
  • 小团队/初创公司:免费额度充足,无需自建复杂安全基础设施
  • AI 安全研究者:开源代码便于研究提示词注入检测机制

不适合对数据主权有严格要求的企业(必须外发消息检测),或需要完全离线运行的气隙环境。

使用风险

网络与可用性风险:外部 API 调用无超时设置,网络异常时可能导致请求挂起;免费额度耗尽后服务中断。

数据外泄风险:用户消息内容必须发送至第三方服务器检测,虽经加密且声明不存储,但仍存在理论上的数据可见性风险。

供应链单一风险:检测能力完全依赖 Glitchward 的服务持续运营,建议关注其商业稳定性。

配置泄露风险:API Token 需通过环境变量配置,不当管理(如提交至 Git)可能导致 Token 泄露被盗用。

Glitchward Shield 内容

手动下载zip · 7.8 kB
llm-shield-skill.jstext/javascript
请选择文件