核心用法
Quorum 是一个多智能体验证框架,通过启动多个独立的AI评审员(critics)对AI生成的产物(artifact)进行结构化审查。用户通过CLI指定目标文件和评分标准(rubric),框架自动协调多个LLM实例并行评估,最终输出结构化的裁决结果。
基础工作流程:
1. 预筛选(Pre-screen):10项确定性检查,包括凭证泄露、PII、语法错误、断链、TODO等
2. 多评审员评估:根据深度配置启动2-5个专业评审员(正确性、完整性、安全性、测试员、代码规范)
3. 证据驱动:每项批评必须引用具体证据位置
4. 结构化裁决:PASS / PASS_WITH_NOTES / REVISE / REJECT
深度配置:
quick:2评审员,5-10分钟standard(默认):4评审员+预筛选,15-30分钟thorough:5评审员+修复循环,30-60分钟
内置评分标准:
research-synthesis:研究报告、文献综述agent-config:智能体配置、YAML规范、系统提示词python-code:Python源码(25项标准PC-001~PC-025,自动识别.py文件)
显著优点
- 多智能体冗余:6个独立评审员减少单一模型的偏差和盲点
- 强制证据链:每项发现必须包含证据引用,避免幻觉式批评
- 分层模型策略:tier_1用于裁决角色,tier_2用于评估角色,成本与质量平衡
- 确定性预筛选:10项硬规则检查在LLM运行前拦截常见错误
- 可扩展架构:支持自定义rubrics(JSON格式)和cross-artifact一致性检查
- 明确的退出码:0=通过/附注通过,1=错误,2=需修订/拒绝,便于CI/CD集成
潜在缺点与局限性
- 成本累积:多轮LLM调用(尤其是
thorough模式+修复循环)API费用显著 - 时间开销:即使是quick模式也需5-10分钟,不适合实时场景
- 模型依赖:需要Anthropic或OpenAI API密钥,无本地/离线运行选项
- 评审员黑箱:虽然要求证据引用,但评审员本身的推理过程透明度有限
- Python生态绑定:参考实现为Python,集成到其他语言环境需额外工作
- 修复循环局限:
thorough模式的fix loops可能陷入迭代,无自动收敛保证
适合人群
- AI应用开发者:验证智能体配置、系统提示词的质量
- 技术写作团队:审查研究报告、技术文档的准确性和完整性
- 代码审查流程:Python项目的自动化代码质量门禁
- AI安全研究人员:需要结构化、可复现的生成物评估方法
- 企业合规团队:对AI输出有审计和留痕需求的场景
常规风险
- API密钥泄露风险:需配置
ANTHROPIC_API_KEY或OPENAI_API_KEY,存在意外提交到版本控制的风险(虽有预筛选检测) - 数据出境:产物内容需发送至第三方LLM API,敏感数据需脱敏
- 评审一致性:多评审员可能产生矛盾判断,最终裁决依赖聚合逻辑
- 过度依赖结构化输出:复杂创意或主观质量难以量化评估
- 供应链风险:依赖外部git仓库和PyPI包,需验证来源完整性