核心用法
Quorum 是一个开源的多智能体验证框架,用于系统性地评估 AI 代理生成的各类产物(artifacts)。其工作流程分为两个阶段:首先执行确定性预筛选(10项检查,包括凭证泄露、PII检测、语法错误、断链、TODO标记等),然后启动多个独立的 LLM 评审员(critics)基于结构化评分标准(rubric)进行评估。
三种深度配置:
quick(2评审员+预筛选,5-10分钟)standard(4评审员+预筛选,15-30分钟,默认)thorough(全量评审员+预筛选,30-60分钟)
内置评分标准:research-synthesis(研究报告)、agent-config(代理配置),支持自定义 JSON 评分标准。
高级功能:批量目录验证(通配符模式)、跨产物一致性检查(通过关系定义文件)。
显著优点
1. 证据锚定:每项批评必须引用产物中的具体位置,避免幻觉评审
2. 结构化输出:四级 verdict(PASS/PASS_WITH_NOTES/REVISE/REJECT),带严重级别标注
3. 模型分层:支持 tier-1(判断角色)与 tier-2(评估角色)模型分离配置
4. 确定性预筛选:在调用昂贵 LLM 前快速拦截基础错误
5. 开源可扩展:基于 Python,可自定义评分标准与评审员
潜在局限
- 成本累积:4评审员×多轮深度验证,大规模使用成本显著
- 模型依赖:目前主要优化 Claude/ GPT 系列,其他模型兼容性待验证
- 延迟瓶颈:深度模式单次验证可达1小时,不适用于实时场景
- 配置门槛:YAML 配置、关系定义文件需一定学习成本
- 边界约束:存在内部专有组件(CKMS命名规范等),部分功能未完全开源
适合人群
- AI 工程师:验证代理配置文件、系统提示词
- 研究团队:同行评审式地验证文献综述、技术报告
- 合规团队:批量审计文档一致性、检测敏感信息泄露
- 开源维护者:代码审查前的自动化质量关卡
常规风险
| 风险类型 | 说明 | 缓解措施 |
|---------|------|---------|
| API 密钥泄露 | 产物中可能包含硬编码凭证 | 预筛选自动检测+评审员二次确认 |
| 评审员一致性差 | 不同模型/参数导致分歧 | 多评审员投票机制,显性分歧记录 |
| 证据幻觉 | LLM 伪造引用位置 | 要求行号/段落级精确引用,人工抽查 |
| 成本失控 | 大批量验证费用激增 | 默认 quick 模式,目录级分批执行 |
| 配置漂移 | 评分标准版本不一致 | `quorum rubrics list` 锁定版本 |
技术栈
Python 3 + pip,依赖 Anthropic/ OpenAI API。安装通过 git clone 源码,无 PyPI 包。