核心用法
Quorum 是一个多智能体验证框架,旨在通过生成多个独立的 AI 评审员(critics)来审查 AI 代理的输出。用户通过命令行工具指定目标文件(artifact)和评估标准(rubric),系统将自动调用配置的大语言模型进行并行评估。
基本工作流:
1. 克隆仓库并安装 Python 依赖
2. 配置 API 密钥(Anthropic 或 OpenAI)
3. 运行 quorum.cli run 命令,指定 --target 和 --rubric 参数
4. 系统输出结构化裁决(PASS / PASS_WITH_NOTES / FAIL)及带证据引用的详细发现
关键特性:
- 三档深度配置:
quick(3 评审员,5-15 分钟)、standard(6 评审员+1 轮修复,默认)、thorough(9 评审员+外部验证,45-90 分钟) - 内置标准:支持研究报告验证(
research-synthesis)和代理配置检查(agent-config) - 证据锚定:每个发现必须引用原文具体位置,杜绝幻觉
- 分级严重度:CRITICAL / HIGH / MEDIUM / LOW 四级问题分类
显著优点
1. 系统性缺陷捕获:多评审员交叉验证显著降低单一模型幻觉导致的漏检风险
2. 可审计的输出:结构化裁决附带精确证据引用,便于人工复核
3. 灵活配置:深度档位和模型层级(tier_1 判断层/tier_2 评估层)可按需调整成本-质量权衡
4. 开源透明:SPEC.md 完整公开架构设计,社区可扩展自定义标准
潜在局限
1. 成本累积:thorough 模式调用 9+ 个评审员及多轮修复,Token 消耗可能显著
2. 模型依赖:当前仅支持 Anthropic 和 OpenAI 系列模型,对本地或开源模型支持有限
3. 标准覆盖有限:内置标准仅两种,复杂领域需自行开发 rubric
4. 延迟敏感:即使 quick 模式也需 5-15 分钟,不适合实时验证场景
适合人群
- AI 应用开发者:验证代理配置和系统提示的安全性
- 研究团队:交叉审查文献综述和技术报告的事实准确性
- 企业内容审核:高价值文档(合同、政策、医疗建议)的发布前检查
- 提示工程师:迭代优化系统提示的健壮性
常规风险
1. API 密钥泄露:quorum-config.yaml 或环境变量中存储的密钥需严格保管
2. 评审员一致性偏差:多模型架构可能因底层训练差异产生分歧,需人工仲裁
3. 过度自信风险:PASS 裁决不代表绝对正确,仅表示未检出显著问题
4. 供应链安全:从 GitHub 直接 pip 安装依赖需验证仓库可信性