Prompt Guard

🛡️ AI代理的分布式威胁防御中枢

AI 增强榜 #21

面向AI代理的先进提示注入防御系统,集成HiveFence分布式威胁情报网络,支持多语言攻击检测与实时 severity 评分,为Clawdbot提供企业级安全防护。

收藏
50.4k
安装
12.8k
版本
2.5.3
CLS 安全性认证2026-07-13
点击查看完整报告 >

使用说明

Prompt Guard v2.6.0 是一款专为AI代理设计的高级提示注入防御与运营安全系统,核心能力涵盖三大维度:

威胁检测与防御:集成349种攻击模式库(较v2.4提升2.7倍),覆盖直接注入(指令覆盖、角色操纵)、间接注入(恶意文件/URL/编码陷阱)、多轮攻击(渐进信任构建、上下文投毒)及场景化越狱(梦境叙事、学术研究伪装等)。独创的HiveFence分布式情报网络实现"单点检测、全网免疫"——任一代理发现威胁即上报社区验证,所有节点自动获得防护更新。

多语言与语义深度:支持英语、韩语、日语、中文四种语言的攻击模式识别,不仅匹配关键词,更理解社交工程话术(如"아까 허락했잖아"单点授权扩张攻击)、紧急情感操控("医院将受攻击"威胁框架)及权威冒充("我是管理员")。v2.6.0新增系统提示词模拟检测,可识别<claude_*>[INST]等伪造LLM内部标记。

秘密保护与基础设施安全:强制执行"聊天中绝不输出密钥"原则,自动拦截config/环境变量/凭证展示请求;提供网关绑定策略(loopback/lan/Tailscale)、SSH加固清单、浏览器会话隔离等运营安全指南。

显著优点:社区驱动的威胁情报更新、精细化severity分级(SAFE→CRITICAL五档)、可配置响应策略(日志/警告/拦截/通知所有者)、完善的审计工具链(detect/analyze_log/audit脚本)。

潜在局限:HiveFence网络依赖社区活跃度,边缘攻击模式可能存在检测延迟;高度敏感的paranoid模式可能产生误报;多语言支持深度不均(英语/韩语最完善)。

适合人群:部署Clawdbot的Telegram Bot运营者、需要保护AI代理免受提示注入的开发者、处理敏感数据的自动化工作流构建者、多用户群组场景下的AI服务管理员。

常规风险:配置不当可能导致服务中断(如webhook模式绑定loopback);过度依赖自动拦截可能影响用户体验;凭证轮换策略执行不及时可能造成实际泄露。

安全解读

Prompt Guard v2.6.0 综合评估

核心用法

Prompt Guard 是专为 AI Agent(Clawdbot)设计的提示词注入防御系统,采用分层检测架构:

1. 实时分析引擎:通过 detect.py 对用户输入进行多维度扫描,识别 349+ 种攻击模式
2. 分级响应机制:SAFE/LOW/MEDIUM/HIGH/CRITICAL 五级严重度,对应 allow/log/warn/block/block_notify 动作

3. HiveFence 网络:可选接入分布式威胁情报网络,实现「单点检测、全网免疫」的集体防御

4. 多语言支持:原生覆盖英语、韩语、日语、中文的攻击模式检测

典型调用流程

from scripts.detect import PromptGuard
guard = PromptGuard(config_path="config.yaml")
result = guard.analyze("用户消息", context={"user_id": "123", "is_group": True})
# result.action → "block" / "warn" / "allow" 等

显著优点

  • 零依赖风险:仅使用 Python 标准库(os/sys/re/json/hashlib),无第三方供应链攻击面
  • 攻击覆盖全面:直接注入(指令覆盖/角色操纵)、间接注入(文件/URL/图片载荷)、多轮攻击(渐进式信任建立)、社会工程(权威冒充/紧急压力)、令牌混淆(Unicode 同形字符/Base64)
  • 场景化防御:针对 2026 年最新攻击趋势(单授权扩展攻击、凭证路径收割、DM 社工、Claude 系统提示模拟等)
  • 隐私可控:日志记录可配置是否包含原始消息,符合 GDPR 数据最小化原则
  • 开源可审计:MIT 协议,GitHub 完全公开,安全认证报告 A 级(CLS-2026-0714-PG253)

潜在缺点与局限性

  • 外部 API 依赖:HiveFence 功能需连接作者自托管的 Cloudflare Workers(hivefence-api.seojoon-kim.workers.dev),企业环境需评估数据出境合规性
  • 正则性能瓶颈:349+ 正则模式串行匹配,极端长文本可能产生延迟(未实现 NFA 优化或 GPU 加速)
  • 无对抗训练:基于规则而非机器学习,对新型零日攻击(如语义混淆攻击)检测能力有限
  • 日志存储风险:默认写入 memory/security-log.md,若配置不当可能泄露检测历史
  • Owner 判定单一:仅通过 Telegram user ID 识别,无多因素认证或行为基线分析

适合人群

  • AI Agent 运营者:运行 Clawdbot 等 LLM 机器人的个人或团队
  • 多语言场景用户:服务韩/日/中用户群体的国际化部署
  • 安全意识较强的开发者:愿意投入时间配置细粒度策略(sensitivity: paranoid 模式)
  • 小型开源项目:追求零依赖、轻量部署的技术方案

不建议

  • 高合规要求的企业(金融、医疗)直接依赖 HiveFence 外部 API
  • 需要实时对抗训练/自适应学习的动态威胁场景

常规风险

| 风险类型 | 等级 | 说明 |
|---------|------|------|
| 外部 API 数据泄露 | 低-中 | HiveFence 上报攻击模式哈希,虽非原始消息但存在元数据暴露 |
| 日志文件权限漂移 | 低 | 若 umask 配置不当,安全日志可能被其他用户读取 |
| 误报干扰 | 中 | 创意写作、角色扮演场景可能触发 MEDIUM 级警告 |
| 网络隔离失效 | 中 | Webhook + `bind: 0.0.0.0` 配置错误导致网关暴露 |

安全加固建议

1. 禁用 HiveFence(高敏感环境):hivefence.enabled: false
2. 最小化日志include_message: false,定期清理旧日志

3. 网关绑定 loopback:配合 polling 模式使用,或 Tailscale VPN 替代公网暴露

4. 文件权限chmod 700 ~/.clawdbot/ + chmod 600 clawdbot.json

5. 令牌轮换:任何疑似暴露立即通过 @BotFather 撤销并重置

Prompt Guard 内容

blog文件夹
scripts文件夹
手动下载zip · 49.2 kB
how-i-secured-my-ai-agent.mdtext/markdown
请选择文件