核心用法
Quorum 是一款面向 AI 生成物质量控制的多智能体验证框架。用户通过 CLI 指定目标文件(文档、配置、代码、研究报告等)与评估维度(rubric),系统自动生成多个独立的 AI Critic 角色,依据证据链原则并行审查,最终输出结构化 verdict。
关键操作路径:
quorum run --target <file> --rubric <name>启动验证- 支持
quick/standard/thorough三级深度,时间与成本逐级递增 - 内置
research-synthesis与agent-config两类标准 rubric
显著优点
1. 证据驱动:每项批评必须附带具体位置引用,避免模糊断言
2. 角色隔离:Critic 独立生成、互不干扰,模拟交叉评审机制
3. 分级响应:CRITICAL/HIGH/MEDIUM/LOW 四级 severity 与对应修复策略
4. 模型灵活:支持 Anthropic/Claude、OpenAI 等多厂商模型,可配置 tier 分工
潜在局限与风险
| 维度 | 说明 |
|------|------|
| **成本敏感** | thorough 模式调用 9+ Critics + 外部验证,Token 消耗高 |
| **延迟瓶颈** | 标准模式 15-30 分钟,不适用于实时场景 |
| **Rubric 依赖** | 当前仅两类内置 rubric,自定义需手动编写 |
| **模型偏见传递** | 若基础模型存在系统性偏见,Critic 可能放大而非消除 |
| **证据幻觉** | 虽要求 citation,但 LLM 仍可能虚构引用位置 |
适合人群
- AI 产品团队:需对 Agent 输出进行发布前质量 gate
- 研究机构:验证文献综述、技术报告的事实准确性
- 合规/法务场景:需留存审计轨迹的高风险文档审查
常规风险
- API Key 暴露:配置需写入环境变量,共享环境存在泄露风险
- 供应链安全:通过 pip 安装依赖,需审查 requirements.txt 来源
- 误判成本:PASS_WITH_NOTES 与 FAIL 边界模糊,可能过度拦截或漏放
结论
Quorum 填补了 AI 生成物"可验证性"工具链的空白,适合将 LLM 输出可靠性从"信任模型"转为"信任证据"。建议以 standard 深度作为默认基线,thorough 仅用于高 stakes 场景,并配套人工抽检机制。