benchmark-robustness-auditor

🎯 大模型评测安全审计专家

MIT开源的LLM基准测试红队审计工具,提供可执行脚本检测数据污染、提示注入等12类漏洞,配套缓解策略库与严重程度计算器,专为AI安全研究团队打造。

收藏
1.4k
安装
340
版本
1.1.3
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

benchmark-robustness-auditor 是一套面向大语言模型(LLM)基准测试的安全审计技能,通过可执行的 Python 脚本对评测数据集进行系统性 robustness 检测。用户指定数据集路径(HuggingFace、本地或自定义评测文件)后,技能分两个阶段执行:第一阶段运行污染审计(n-gram 精确匹配、语义改写检测、日期污染检查);第二阶段执行漏洞利用目录扫描(选项偏见、少样本 priming、CoT 泄露、工具调用作弊、评估器注入等)。所有检测结果通过 severity_calculator 输出 0-100 分的严重度评分及预估分数膨胀率,最终生成符合 robustness_report.md.template 标准的结构化报告。

关键可执行脚本

  • ngram_contamination.py:滚动哈希 13-gram 匹配,120 秒超时保护
  • paraphrase_audit.py:基于 E5-Mistral 嵌入的语义去重,支持 33 倍加速的缓存复用
  • date_contamination_checker.py:调用 GitHub API 验证 LiveCodeBench 等代码题首次公开日期
  • evaluator_injection_harness.py:对 LLM-as-Judge 执行隐藏指令载荷测试
  • option_bias_shuffle.py:四重排列组合检测 MCQ 选项位置偏见
  • cot_leakage_detector.py:识别推理模型在 <thinking> 标签中泄露答案的 T-4 型漏洞

显著优点

1. 完全可执行:v1.2.0 修复了早期版本仅有抽象代码片段的问题,提供 5+ 生产级脚本,支持 CLI 直接调用与 CI 集成。

2. 漏洞覆盖前沿:新增 2026 年发现的 CoT 泄露(T-4)、工具调用作弊(T-5)、Markdown 隐藏注入(E-3)三类利用方式,覆盖推理模型与 Agent 评测场景。

3. 量化风险评估:独创 severity_calculator.json 模式,结合证据强度、分数膨胀率、影响样本比例输出结构化评级(Critical/High/Medium/Low),便于优先级排序。

4. 防御闭环完整:mitigations/ 目录提供 5 种缓解策略(排列集成、盲评、分层少样本、GitHub 日期校验、CoT 净化),实现"检测-量化-修复"全链路。

5. 性能与可靠性优化:集成 prompt-cache 实现嵌入缓存 33 倍加速,sandbox-selfheal-guard 提供 120 秒超时保护与故障降级。

潜在缺点与局限性

  • 依赖外部服务:日期污染检测需有效 GitHub Token,API 限流或网络中断将导致检测失败;语义改写审计依赖 E5-Mistral 嵌入模型,需本地 GPU 或 API 配额。
  • 基准覆盖有限:当前缓解策略库明确列出 FrontierMath、SWE-bench Verified、LiveCodeBench Pro 的支持,但小众或私有基准需手动适配脚本。
  • 误报风险:n-gram 13 字符匹配在数学/代码题中可能将合法公共知识标记为污染;语义阈值(0.08)需根据领域调参,缺乏自动化校准机制。
  • 防御非绝对:工具调用作弊(T-5)依赖日志监控,若评测框架未暴露调用记录则无法检测;盲评缓解策略可能降低评估效率(需多轮推理)。

适合的目标群体

  • AI 安全研究团队:进行红队审计、评测体系安全加固的科研人员
  • 基准测试维护方:HuggingFace Open LLM Leaderboard、LiveCodeBench 等平台的运营者
  • 大模型厂商内部评测团队:需在模型发布前进行对抗性 robustness 验证的 MLE/Research Engineer
  • 学术同行评审:验证论文声称的 SOTA 结果是否受污染或利用漏洞影响

常规使用风险

  • 性能瓶颈:大规模数据集(如 MMLU 全量)的 paraphrase_audit 即使启用缓存,首次运行仍需显著计算资源;建议分批执行或采样审计。
  • 依赖项版本冲突:技能依赖 sandbox-selfheal-guardprompt_cache_layer 两个外部技能,路径硬编码为 ~/skills/@orionshaowswmw/,跨环境部署需验证目录结构。
  • Token 与隐私:GitHub Token 需具备 public repo 读取权限,存在泄露风险;建议通过环境变量注入并配置最小权限。
  • CI 集成复杂度:报告模板含多章节(C-1 至 M-1),需自定义解析逻辑才能接入自动化流水线,缺乏开箱即用的 GitHub Actions 示例。
  • 法律合规边界:技能明确标注"Defensive/research only",但内置 PoC exploit 脚本存在被滥用于刷榜的风险,使用者需遵守目标平台服务条款。

benchmark-robustness-auditor 内容

手动下载zip · 5.7 kB
README.mdtext/markdown
请选择文件