Sharedintellect Quorum

⚖️ 多智能体交叉验证,证据锚定裁决

多智能体验证框架,通过独立 AI 评审员交叉审查文档、代码、配置等产出,输出结构化裁决与证据锚定的改进建议。

收藏
5.5k
安装
1.1k
版本
1.0.2
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Quorum 是一个多智能体验证框架,旨在通过生成多个独立的 AI 评审员(critics)来审查 AI 代理的输出。用户通过命令行工具指定目标文件(artifact)和评估标准(rubric),系统将自动调用配置的大语言模型进行并行评估。

基本工作流
1. 克隆仓库并安装 Python 依赖

2. 配置 API 密钥(Anthropic 或 OpenAI)

3. 运行 quorum.cli run 命令,指定 --target--rubric 参数

4. 系统输出结构化裁决(PASS / PASS_WITH_NOTES / FAIL)及带证据引用的详细发现

关键特性

  • 三档深度配置:quick(3 评审员,5-15 分钟)、standard(6 评审员+1 轮修复,默认)、thorough(9 评审员+外部验证,45-90 分钟)
  • 内置标准:支持研究报告验证(research-synthesis)和代理配置检查(agent-config
  • 证据锚定:每个发现必须引用原文具体位置,杜绝幻觉
  • 分级严重度:CRITICAL / HIGH / MEDIUM / LOW 四级问题分类

显著优点

1. 系统性缺陷捕获:多评审员交叉验证显著降低单一模型幻觉导致的漏检风险
2. 可审计的输出:结构化裁决附带精确证据引用,便于人工复核

3. 灵活配置:深度档位和模型层级(tier_1 判断层/tier_2 评估层)可按需调整成本-质量权衡

4. 开源透明:SPEC.md 完整公开架构设计,社区可扩展自定义标准

潜在局限

1. 成本累积:thorough 模式调用 9+ 个评审员及多轮修复,Token 消耗可能显著
2. 模型依赖:当前仅支持 Anthropic 和 OpenAI 系列模型,对本地或开源模型支持有限

3. 标准覆盖有限:内置标准仅两种,复杂领域需自行开发 rubric

4. 延迟敏感:即使 quick 模式也需 5-15 分钟,不适合实时验证场景

适合人群

  • AI 应用开发者:验证代理配置和系统提示的安全性
  • 研究团队:交叉审查文献综述和技术报告的事实准确性
  • 企业内容审核:高价值文档(合同、政策、医疗建议)的发布前检查
  • 提示工程师:迭代优化系统提示的健壮性

常规风险

1. API 密钥泄露quorum-config.yaml 或环境变量中存储的密钥需严格保管
2. 评审员一致性偏差:多模型架构可能因底层训练差异产生分歧,需人工仲裁

3. 过度自信风险:PASS 裁决不代表绝对正确,仅表示未检出显著问题

4. 供应链安全:从 GitHub 直接 pip 安装依赖需验证仓库可信性

Sharedintellect Quorum 内容

archive文件夹
branding文件夹
docs文件夹
examples文件夹
rubrics文件夹
reference-implementation文件夹
examples文件夹
quorum文件夹
agents文件夹
configs文件夹
critics文件夹
providers文件夹
rubrics文件夹
builtin文件夹
tools文件夹
手动下载zip · 97.1 kB
akkari-x-thread-v1.mdtext/markdown
请选择文件