核心用法
Quorum 是一个多智能体验证框架,通过确定性预检 + 4个独立AI评审员的机制,对AI生成的各类产物(文档、配置、代码、研究报告等)进行结构化质量评估。
执行流程:
1. 预检阶段:自动执行10项确定性检查(凭证泄露、PII、语法错误、死链、TODO标记等)
2. 评审阶段: spawn 多个独立 LLM 评审员,按评分标准逐项评估
3. 裁决输出:生成结构化 verdict(PASS / PASS_WITH_NOTES / REVISE / REJECT),附带证据引用和修复建议
三种深度模式:
quick(~5-10分钟):2个评审员(正确性、完整性)standard(默认,~15-30分钟):4个评审员(+安全性、代码规范)thorough(~30-60分钟):全量评审 + 跨产物一致性检查
典型场景:研究报告验证、Agent配置审计、代码审查、批量文档质检、跨产物一致性校验。
---
显著优点
| 维度 | 优势 |
|------|------|
| **方法论严谨** | 多智能体交叉验证替代单一模型判断,降低个体幻觉风险 |
| **证据驱动** | 每条批评必须引用原文具体位置,可审计、可追溯 |
| **结构化输出** | 标准化裁决等级 + 分级严重度(CRITICAL/HIGH/MEDIUM/LOW)+ 可执行的修复建议 |
| **开箱即用** | 内置 `research-synthesis`、`agent-config` 等常用评分标准 |
| **工程友好** | 支持批量验证、跨产物关系检查、YAML配置、退出码集成CI/CD |
| **成本可控** | 三级深度按需选择,预检过滤明显缺陷减少无效LLM调用 |
---
潜在缺点与局限性
- 成本累积:4个独立评审员 × 多轮调用,大规模验证成本显著高于单模型方案
- 延迟敏感:即使是
quick模式也需5-10分钟,不适合实时场景 - 标准依赖:内置评分标准覆盖有限,复杂领域需自行编写JSON评分标准
- 模型锁定:当前主要优化Anthropic/OpenAI模型,其他模型兼容性待验证
- 边界模糊:文档提示存在内部/公开版本边界,外部贡献者可能混淆
---
适合人群
- AI工程团队:需要对RAG输出、Agent产物进行系统性质检
- 研究机构:验证研究报告、文献综述的事实准确性与逻辑一致性
- DevOps/平台团队:将AI生成配置纳入CI/CD门禁检查
- 内容运营:批量审核AI生成文档的合规性与质量基线
---
常规风险
| 风险类型 | 说明 | 缓解建议 |
|---------|------|---------|
| API密钥暴露 | 需配置`ANTHROPIC_API_KEY`/`OPENAI_API_KEY` | 使用密钥管理服务,避免硬编码 |
| 评审员一致性 | 多模型可能给出矛盾判断 | 依赖裁决聚合逻辑,人工复核边缘案例 |
| 预检漏报 | 确定性检查无法覆盖语义级问题 | 不跳过`standard`及以上深度 |
| 成本失控 | 批量验证 × thorough模式 | 先用`quick`筛选,再对关键产物深度验证 |