核心用法
Quorum 是一个多代理验证框架,用于评估 AI Agent 生成的各类产物(文档、配置、代码、研究报告等)。用户通过 CLI 指定目标文件和评估标准(rubric),框架会生成多个独立的 AI 评审员(critics)并行审查,最终输出结构化的裁决结果。
工作流程
1. 配置初始化:首次运行自动创建 quorum-config.yaml,指定模型层级和深度配置
2. 选择评估标准:内置 research-synthesis(研究报告)和 agent-config(代理配置)两种标准
3. 设置深度级别:quick(3评审员,5-15分钟)、standard(6评审员+1轮修复,15-30分钟)、thorough(9评审员+外部验证+2轮修复,45-90分钟)
4. 执行验证:并行生成评审报告,每个发现必须附带证据引用
5. 获取裁决:PASS / PASS_WITH_NOTES / FAIL 三档结果
显著优点
- 循证评估:每条批评必须引用原文具体位置,避免空泛评价
- 多视角交叉验证:独立评审员减少单一模型偏见
- 可配置深度:从快速检查到深度审计,适应不同场景
- 结构化输出:统一的严重级别分级(CRITICAL/HIGH/MEDIUM/LOW)和修复建议
- 开放架构:支持自定义 rubric 和模型配置
潜在局限
- 依赖外部 API:需配置 Anthropic/OpenAI 密钥,存在成本和可用性风险
- 无本地模型支持:当前仅支持云端大模型,无法离线运行
- Python 环境依赖:需要 Python 3 和 pip 环境,对非技术用户有门槛
- 评审质量上限:最终效果受限于底层模型能力,复杂逻辑错误可能漏检
- 时间成本: thorough 模式可能耗时 90 分钟,不适合实时场景
适合人群
- AI Agent 开发者验证输出质量
- 技术文档审核、代码审查场景
- 需要第三方验证的合规性检查
- 多模型交叉验证以消除幻觉的研究场景
常规风险
- API 密钥泄露:需在环境变量中配置密钥,存在误提交风险
- 评审一致性:不同模型可能对同一问题判定严重级别不一
- 成本不可控:多评审员+多轮修复可能产生高额 token 消耗
- 证据幻觉:评审员引用的"证据位置"可能是虚构的,需人工复核