Sharedintellect Quorum

⚖️ 多智能体验证框架,证据驱动评审

Quorum 是多智能体验证框架,通过确定性预筛选+4个独立AI评审员对文档、代码等产物进行基于证据的评估,支持批量验证与跨产物一致性检查。

收藏
5.4k
安装
1.1k
版本
0.5.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Quorum 是一个开源的多智能体验证框架,用于系统性地评估 AI 代理生成的各类产物(artifacts)。其工作流程分为两个阶段:首先执行确定性预筛选(10项检查,包括凭证泄露、PII检测、语法错误、断链、TODO标记等),然后启动多个独立的 LLM 评审员(critics)基于结构化评分标准(rubric)进行评估。

三种深度配置

  • quick(2评审员+预筛选,5-10分钟)
  • standard(4评审员+预筛选,15-30分钟,默认)
  • thorough(全量评审员+预筛选,30-60分钟)

内置评分标准research-synthesis(研究报告)、agent-config(代理配置),支持自定义 JSON 评分标准。

高级功能:批量目录验证(通配符模式)、跨产物一致性检查(通过关系定义文件)。

显著优点

1. 证据锚定:每项批评必须引用产物中的具体位置,避免幻觉评审
2. 结构化输出:四级 verdict(PASS/PASS_WITH_NOTES/REVISE/REJECT),带严重级别标注

3. 模型分层:支持 tier-1(判断角色)与 tier-2(评估角色)模型分离配置

4. 确定性预筛选:在调用昂贵 LLM 前快速拦截基础错误

5. 开源可扩展:基于 Python,可自定义评分标准与评审员

潜在局限

  • 成本累积:4评审员×多轮深度验证,大规模使用成本显著
  • 模型依赖:目前主要优化 Claude/ GPT 系列,其他模型兼容性待验证
  • 延迟瓶颈:深度模式单次验证可达1小时,不适用于实时场景
  • 配置门槛:YAML 配置、关系定义文件需一定学习成本
  • 边界约束:存在内部专有组件(CKMS命名规范等),部分功能未完全开源

适合人群

  • AI 工程师:验证代理配置文件、系统提示词
  • 研究团队:同行评审式地验证文献综述、技术报告
  • 合规团队:批量审计文档一致性、检测敏感信息泄露
  • 开源维护者:代码审查前的自动化质量关卡

常规风险

| 风险类型 | 说明 | 缓解措施 |
|---------|------|---------|
| API 密钥泄露 | 产物中可能包含硬编码凭证 | 预筛选自动检测+评审员二次确认 |
| 评审员一致性差 | 不同模型/参数导致分歧 | 多评审员投票机制,显性分歧记录 |
| 证据幻觉 | LLM 伪造引用位置 | 要求行号/段落级精确引用,人工抽查 |
| 成本失控 | 大批量验证费用激增 | 默认 quick 模式,目录级分批执行 |
| 配置漂移 | 评分标准版本不一致 | `quorum rubrics list` 锁定版本 |

技术栈

Python 3 + pip,依赖 Anthropic/ OpenAI API。安装通过 git clone 源码,无 PyPI 包。

Sharedintellect Quorum 内容

docs文件夹
research文件夹
手动下载zip · 113.2 kB
cisq-quality-measures.mdtext/markdown
请选择文件