Prompt Guard v2.6.0 综合评估
核心用法
Prompt Guard 是专为 AI Agent(Clawdbot)设计的提示词注入防御系统,采用分层检测架构:
1. 实时分析引擎:通过 detect.py 对用户输入进行多维度扫描,识别 349+ 种攻击模式
2. 分级响应机制:SAFE/LOW/MEDIUM/HIGH/CRITICAL 五级严重度,对应 allow/log/warn/block/block_notify 动作
3. HiveFence 网络:可选接入分布式威胁情报网络,实现「单点检测、全网免疫」的集体防御
4. 多语言支持:原生覆盖英语、韩语、日语、中文的攻击模式检测
典型调用流程:
from scripts.detect import PromptGuard
guard = PromptGuard(config_path="config.yaml")
result = guard.analyze("用户消息", context={"user_id": "123", "is_group": True})
# result.action → "block" / "warn" / "allow" 等显著优点
- 零依赖风险:仅使用 Python 标准库(os/sys/re/json/hashlib),无第三方供应链攻击面
- 攻击覆盖全面:直接注入(指令覆盖/角色操纵)、间接注入(文件/URL/图片载荷)、多轮攻击(渐进式信任建立)、社会工程(权威冒充/紧急压力)、令牌混淆(Unicode 同形字符/Base64)
- 场景化防御:针对 2026 年最新攻击趋势(单授权扩展攻击、凭证路径收割、DM 社工、Claude 系统提示模拟等)
- 隐私可控:日志记录可配置是否包含原始消息,符合 GDPR 数据最小化原则
- 开源可审计:MIT 协议,GitHub 完全公开,安全认证报告 A 级(CLS-2026-0714-PG253)
潜在缺点与局限性
- 外部 API 依赖:HiveFence 功能需连接作者自托管的 Cloudflare Workers(
hivefence-api.seojoon-kim.workers.dev),企业环境需评估数据出境合规性 - 正则性能瓶颈:349+ 正则模式串行匹配,极端长文本可能产生延迟(未实现 NFA 优化或 GPU 加速)
- 无对抗训练:基于规则而非机器学习,对新型零日攻击(如语义混淆攻击)检测能力有限
- 日志存储风险:默认写入
memory/security-log.md,若配置不当可能泄露检测历史 - Owner 判定单一:仅通过 Telegram user ID 识别,无多因素认证或行为基线分析
适合人群
- AI Agent 运营者:运行 Clawdbot 等 LLM 机器人的个人或团队
- 多语言场景用户:服务韩/日/中用户群体的国际化部署
- 安全意识较强的开发者:愿意投入时间配置细粒度策略(sensitivity: paranoid 模式)
- 小型开源项目:追求零依赖、轻量部署的技术方案
不建议:
- 高合规要求的企业(金融、医疗)直接依赖 HiveFence 外部 API
- 需要实时对抗训练/自适应学习的动态威胁场景
常规风险
| 风险类型 | 等级 | 说明 |
|---------|------|------|
| 外部 API 数据泄露 | 低-中 | HiveFence 上报攻击模式哈希,虽非原始消息但存在元数据暴露 |
| 日志文件权限漂移 | 低 | 若 umask 配置不当,安全日志可能被其他用户读取 |
| 误报干扰 | 中 | 创意写作、角色扮演场景可能触发 MEDIUM 级警告 |
| 网络隔离失效 | 中 | Webhook + `bind: 0.0.0.0` 配置错误导致网关暴露 |
安全加固建议
1. 禁用 HiveFence(高敏感环境):hivefence.enabled: false
2. 最小化日志:include_message: false,定期清理旧日志
3. 网关绑定 loopback:配合 polling 模式使用,或 Tailscale VPN 替代公网暴露
4. 文件权限:chmod 700 ~/.clawdbot/ + chmod 600 clawdbot.json
5. 令牌轮换:任何疑似暴露立即通过 @BotFather 撤销并重置