Multi Model Consensus

🏛️ AI智库协同决策,消除偏见万模共鉴

多模型协同决策系统,通过3-6个异构模型背对背评审、对抗辩论与共识合成,消除单模型偏见,为复杂决策提供量化、透明、可追溯的参考建议。

收藏
2.9k
安装
982
版本
1.6.6
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

多模型决策委员会(Multi-Model Consensus)是面向 OpenClaw 平台的去中心化决策基础设施,采用「数字智库」模式运行:

标准决策流程
1. 第0轮·准备 — 组织者拆解决策点为加权维度,配置委员模型组合(建议含强逻辑+强中文模型各1个)

2. 第1轮·独立评估 — 3-6个模型背对背盲审,按单方案/二选一/决策点拆分三种模式评分(0-100分制)

3. 第2轮·分歧讨论 — 仅针对未通过决策点(<阈值)下发所有委员重新评审

4. 第3轮·最终辩论 — 对仍存分歧的决策点进行末轮裁决

关键配置参数

  • 轮数:2-6轮(日常事务2轮,架构/资金决策3-5轮)
  • 阈值:严谨型≥95%全票通过,效率型≥75%多数通过
  • 判定方式:全票通过(默认)/均分通过/多数票通过

输出成果:6段式共识报告 —— 投票记录、汇总说明、执行方案、决策点通过清单、结论摘要、风险提示。

---

显著优点

1. 偏见消除机制
「身份纯净原则」强制要求委员仅标注模型名称,严禁设定角色标签或诱导性提示,从根本上阻断单一模型的认知盲区与立场预设。

2. 量化可追溯
决策点级评分矩阵+加权计算,每轮结果可视化呈现,支持历史回溯与责任认定。

3. 弹性适配

  • 复杂度适配:单方案/二选一/多决策点拆分三种评审模式
  • 环境适配:自动识别 Webchat/Feishu/Discord 通道,切换 subagent/acp 运行时
  • 规模适配:2-6个委员动态扩容

4. 对抗性质量保障
模型间互评机制迫使逻辑漏洞在分歧讨论轮次暴露,优于单模型自我检查。

---

潜在缺点与局限性

1. 时间与算力成本
每轮120秒×3轮×多模型并发,复杂决策可能消耗10分钟以上等待时间,高频场景适用性受限。

2. 结果不确定性
「全票通过」制可能因单个模型的极端评分导致决策僵局,需人工介入调整阈值或判定方式。

3. 技术依赖风险

  • 子Agent结果回流依赖 subagent_announce 事件机制,环境配置错误(如未使用 sessions_yield)将导致流程中断
  • 超时评委(120秒未返回)直接标记为「未提交」,可能降低决策代表性

4. 解释成本
6段式报告结构复杂,普通用户需学习成本理解「待决策」「有分歧」等状态标注含义。

---

适合人群

| 用户类型 | 典型场景 |
|:---|:---|
| 技术架构师 | 系统架构选型、技术债务评估、重构方案评审 |
| 产品经理 | 功能优先级排序、AB测试方案裁决、需求可行性论证 |
| 投资/风控决策者 | 项目尽调、风险评估、多维度打分决策 |
| 内容/策略审核 | 敏感内容多维度研判、政策合规性交叉验证 |
| 科研/学术用户 | 实验方案评审、论文方法学质疑、多专家意见合成 |

不适合:追求秒级响应的实时场景、预算敏感的轻量决策、已存在明确唯一正确答案的简单判断。

---

常规风险

1. 流程合规风险

  • 严禁子Agent二次委托(评委不得 spawn 子Agent),违规将导致决策链不可控
  • 组织者若同时为委员,必须遵守「评审不重复原则」,禁止自评叠加

2. 数据安全边界

  • Read 工具受限:仅能访问 skill 目录与 ~/.openclaw/workspace/tmp_mmc_*.md,禁止触碰用户主目录隐藏文件
  • Write 工具受限:仅允许写入 workspace/memory、临时文件及 Desktop 最终报告

3. 共识幻觉风险
多模型一致意见未必等同于正确结论,可能存在系统性偏见(如训练数据同源导致的群体性误判),最终决策仍需人类负责人背书。

4. 配置误用风险

  • 「改阈值」指令若设定过低(如<50%),将丧失决策筛选意义
  • 委员模型选择同质化(如全选 GPT 系列)削弱「去中心化」价值

---

> 版本提示:当前文档基于 v1.6.5,V1.6.0 起已废弃状态文件机制,改用会话上下文跟踪,旧版集成代码需同步更新。

Multi Model Consensus 内容

docs文件夹
references文件夹
手动下载zip · 51.7 kB
README.mdtext/markdown
请选择文件