Sharedintellect Quorum

⚖️ 多AI交叉验证,让AI产物更可靠

多智能体验证框架,4个独立AI评审员基于证据对文档/代码/配置进行交叉验证,输出结构化裁决结果

收藏
4.3k
安装
1.1k
版本
0.3.1
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Quorum 是一个多智能体验证框架,通过确定性预检 + 4个独立AI评审员的机制,对AI生成的各类产物(文档、配置、代码、研究报告等)进行结构化质量评估。

执行流程
1. 预检阶段:自动执行10项确定性检查(凭证泄露、PII、语法错误、死链、TODO标记等)

2. 评审阶段: spawn 多个独立 LLM 评审员,按评分标准逐项评估

3. 裁决输出:生成结构化 verdict(PASS / PASS_WITH_NOTES / REVISE / REJECT),附带证据引用和修复建议

三种深度模式

  • quick(~5-10分钟):2个评审员(正确性、完整性)
  • standard(默认,~15-30分钟):4个评审员(+安全性、代码规范)
  • thorough(~30-60分钟):全量评审 + 跨产物一致性检查

典型场景:研究报告验证、Agent配置审计、代码审查、批量文档质检、跨产物一致性校验。

---

显著优点

| 维度 | 优势 |
|------|------|
| **方法论严谨** | 多智能体交叉验证替代单一模型判断,降低个体幻觉风险 |
| **证据驱动** | 每条批评必须引用原文具体位置,可审计、可追溯 |
| **结构化输出** | 标准化裁决等级 + 分级严重度(CRITICAL/HIGH/MEDIUM/LOW)+ 可执行的修复建议 |
| **开箱即用** | 内置 `research-synthesis`、`agent-config` 等常用评分标准 |
| **工程友好** | 支持批量验证、跨产物关系检查、YAML配置、退出码集成CI/CD |
| **成本可控** | 三级深度按需选择,预检过滤明显缺陷减少无效LLM调用 |

---

潜在缺点与局限性

  • 成本累积:4个独立评审员 × 多轮调用,大规模验证成本显著高于单模型方案
  • 延迟敏感:即使是quick模式也需5-10分钟,不适合实时场景
  • 标准依赖:内置评分标准覆盖有限,复杂领域需自行编写JSON评分标准
  • 模型锁定:当前主要优化Anthropic/OpenAI模型,其他模型兼容性待验证
  • 边界模糊:文档提示存在内部/公开版本边界,外部贡献者可能混淆

---

适合人群

  • AI工程团队:需要对RAG输出、Agent产物进行系统性质检
  • 研究机构:验证研究报告、文献综述的事实准确性与逻辑一致性
  • DevOps/平台团队:将AI生成配置纳入CI/CD门禁检查
  • 内容运营:批量审核AI生成文档的合规性与质量基线

---

常规风险

| 风险类型 | 说明 | 缓解建议 |
|---------|------|---------|
| API密钥暴露 | 需配置`ANTHROPIC_API_KEY`/`OPENAI_API_KEY` | 使用密钥管理服务,避免硬编码 |
| 评审员一致性 | 多模型可能给出矛盾判断 | 依赖裁决聚合逻辑,人工复核边缘案例 |
| 预检漏报 | 确定性检查无法覆盖语义级问题 | 不跳过`standard`及以上深度 |
| 成本失控 | 批量验证 ×  thorough模式 | 先用`quick`筛选,再对关键产物深度验证 |

Sharedintellect Quorum 内容

docs文件夹
research文件夹
手动下载zip · 113.0 kB
cisq-quality-measures.mdtext/markdown
请选择文件