Sharedintellect Quorum

⚖️ 多AI交叉验证,让AI产物更可靠

多智能体验证框架,4个独立AI评审员基于证据对文档/代码/配置进行交叉验证,输出结构化裁决结果

收藏
4.3k
安装
1.1k
版本
0.3.1
CLS 安全性认证2026-08-10
点击查看完整报告 >

使用说明

核心用法

Quorum 是一个多智能体验证框架,通过确定性预检 + 4个独立AI评审员的机制,对AI生成的各类产物(文档、配置、代码、研究报告等)进行结构化质量评估。

执行流程
1. 预检阶段:自动执行10项确定性检查(凭证泄露、PII、语法错误、死链、TODO标记等)

2. 评审阶段: spawn 多个独立 LLM 评审员,按评分标准逐项评估

3. 裁决输出:生成结构化 verdict(PASS / PASS_WITH_NOTES / REVISE / REJECT),附带证据引用和修复建议

三种深度模式

  • quick(~5-10分钟):2个评审员(正确性、完整性)
  • standard(默认,~15-30分钟):4个评审员(+安全性、代码规范)
  • thorough(~30-60分钟):全量评审 + 跨产物一致性检查

典型场景:研究报告验证、Agent配置审计、代码审查、批量文档质检、跨产物一致性校验。

---

显著优点

| 维度 | 优势 |
|------|------|
| **方法论严谨** | 多智能体交叉验证替代单一模型判断,降低个体幻觉风险 |
| **证据驱动** | 每条批评必须引用原文具体位置,可审计、可追溯 |
| **结构化输出** | 标准化裁决等级 + 分级严重度(CRITICAL/HIGH/MEDIUM/LOW)+ 可执行的修复建议 |
| **开箱即用** | 内置 `research-synthesis`、`agent-config` 等常用评分标准 |
| **工程友好** | 支持批量验证、跨产物关系检查、YAML配置、退出码集成CI/CD |
| **成本可控** | 三级深度按需选择,预检过滤明显缺陷减少无效LLM调用 |

---

潜在缺点与局限性

  • 成本累积:4个独立评审员 × 多轮调用,大规模验证成本显著高于单模型方案
  • 延迟敏感:即使是quick模式也需5-10分钟,不适合实时场景
  • 标准依赖:内置评分标准覆盖有限,复杂领域需自行编写JSON评分标准
  • 模型锁定:当前主要优化Anthropic/OpenAI模型,其他模型兼容性待验证
  • 边界模糊:文档提示存在内部/公开版本边界,外部贡献者可能混淆

---

适合人群

  • AI工程团队:需要对RAG输出、Agent产物进行系统性质检
  • 研究机构:验证研究报告、文献综述的事实准确性与逻辑一致性
  • DevOps/平台团队:将AI生成配置纳入CI/CD门禁检查
  • 内容运营:批量审核AI生成文档的合规性与质量基线

---

常规风险

| 风险类型 | 说明 | 缓解建议 |
|---------|------|---------|
| API密钥暴露 | 需配置`ANTHROPIC_API_KEY`/`OPENAI_API_KEY` | 使用密钥管理服务,避免硬编码 |
| 评审员一致性 | 多模型可能给出矛盾判断 | 依赖裁决聚合逻辑,人工复核边缘案例 |
| 预检漏报 | 确定性检查无法覆盖语义级问题 | 不跳过`standard`及以上深度 |
| 成本失控 | 批量验证 ×  thorough模式 | 先用`quick`筛选,再对关键产物深度验证 |

安全解读

核心用法

Quorum 是一个多智能体验证框架,用于对 AI Agent 生成的各类产物(文档、配置、代码、研究报告)进行系统性质量审查。其工作流程分为两个阶段:首先执行确定性预筛选(10项检查,包括凭证泄露、PII检测、语法错误、断链、TODO标记等),随后启动4个独立的LLM评审员(正确性、完整性、安全性、代码规范),基于评分标准进行证据化评估。用户通过 CLI 运行 quorum run --target <文件> --rubric <标准> 即可启动验证,支持三种深度模式(quick/standard/thorough)和批量处理、跨产物一致性检查等高级功能。

显著优点

证据驱动的评审机制:每个批评必须引用具体证据,避免模糊判断,大幅提升可追溯性。确定性预筛选:在消耗LLM token前完成基础问题筛查,兼顾效率与成本。灵活的评分标准体系:内置研究综合与Agent配置两种标准,同时支持自定义JSON标准。结构化的裁决输出:四级裁决(PASS/PASS_WITH_NOTES/REVISE/REJECT)配合退出码,便于CI/CD集成。开源与可扩展:MIT许可证,架构清晰,支持自定义评审员和深度配置。

潜在缺点与局限性

外部API依赖性强:核心功能依赖Anthropic/OpenAI API,产生持续成本且受服务可用性制约。时间成本较高:即使quick模式也需5-10分钟,thorough模式可达1小时,不适合高频实时场景。配置门槛不低:需要正确配置模型层级、环境变量和YAML配置,对非技术用户有一定学习曲线。评审质量受模型能力限制:复杂领域专业判断可能受限于当前LLM的推理深度。本地执行环境要求:需要Python 3和pip,对纯容器化或受限环境部署不够友好。

适合的目标群体

  • AI应用开发团队:验证Agent配置、系统提示词和输出质量
  • 研究机构与技术写作团队:审查研究报告、文献综述和技术分析
  • DevOps与平台工程:建立AI生成产物的自动化质量门禁
  • 合规与风控部门:需要可审计的AI输出验证流程
  • 开源项目维护者:批量审查文档、配置和代码贡献

常规使用风险

API密钥管理风险:用户需自行安全存储ANTHROPIC_API_KEY和OPENAI_API_KEY,存在泄露或误提交至版本控制的可能。供应链风险:安装过程涉及从GitHub克隆和执行pip install,需验证URL正确性及依赖完整性。成本累积风险:多评审员+多轮验证可能产生显著的API调用成本,批量处理时需预估预算。评审一致性风险:不同LLM版本或温度设置可能导致评审结果波动,关键场景建议固定模型版本。数据隐私考量:验证内容需发送至第三方API,敏感材料需评估数据外泄风险并考虑本地化处理方案。

Sharedintellect Quorum 内容

docs文件夹
research文件夹
手动下载zip · 113.0 kB
cisq-quality-measures.mdtext/markdown
请选择文件