Dual Thinking

🔍 双模型深度评审与技能工程升级框架

结构化双模型评审与技能工程升级框架,强制自审、多轮验证、原子化补丁与回滚,适合高 stakes 代码与技能迭代。

收藏
2.8k
安装
1.1k
版本
8.5.15
CLS 安全性认证2026-08-04
点击查看完整报告 >

使用说明

Dual Thinking Method — 深度评估

核心用途

dual-thinking 是一种双模型协作评审与自动技能工程升级的方法论,旨在通过「自检立场 → 外部咨询 → 综合决策」的三步架构,对技能、代码、工作流等 artifacts 进行深度审查、重写、加固、弱模型优化、打包、测试与发布准备。其设计目标是将高 stakes 决策从直觉驱动转化为结构化、可验证、可回滚的工程流程。

显著优点

1. 强制结构化输出:无论本地模式还是 API/multi-orchestrator 模式,均要求 SELF_POSITIONCONSULTANT_POSITIONSYNTHESIS 的严格顺序,杜绝跳过步骤的伪收敛。

2. 原子化状态管理与回滚机制State Transition & Rollback Gate 将验证、补丁、状态刷新、连续性恢复绑定为原子序列,验证失败立即回滚到 last-passed 状态,保留失败 diff 供检查。

3. 自进化透镜(Self-Evolution Lock):当审查对象为本 skill 自身或同域技能时,强制采用「外部视角」——优化目标为「当前日期的最强版本」,而非「保护原有结构」。拒绝「已经够好」的舒适区论证。

4. 当前日期趋势锁定(Current-date Internet Trend Grounding Lock):对于涉及当前最佳实践的任务,强制两轮互联网辅助审查(Round 1 外部扫描 + Round 2 本地化挑战),防止用陈旧模型知识冒充趋势感知。

5. OpenClaw 运行时锁定:针对 OpenClaw 生态的技能,强制检查真实本地运行时表面(代码、指令、验证器、打包规则),禁止仅凭通用代理理论推断兼容性。

6. 持久会话不可侵犯性multi 模式下每个 orchestrator 必须保持在同一主题会话中,禁止因「感觉干净」而开新聊天;降解时通过「恢复会话」而非「放弃持久性」解决。

7. 用户声明轮次承诺锁定:用户前置声明的轮次/周期计划具有绑定效力,禁止因「看起来已收敛」而提前终止。

潜在缺点与局限性

  • 认知负荷极高:文档篇幅巨大(约 15,000+ 字),运行时锁规则密集,对人类操作者构成显著记忆负担。
  • 弱模型适配成本高:虽提供 COMPACT 结构作为退路,但核心锁规则仍要求严格的三步架构,低端模型可能难以稳定输出。
  • 延迟敏感场景不适用:双模型往返 + 强制验证 + 可能的回滚迭代,在需要亚分钟响应的场景中不可行。
  • 参考文件与内联锁的紧张关系:文档反复强调「参考文件从属于内联 Runtime Core Lock」,但实际维护中易出现「参考文件悄悄成为第二真相源」的漂移风险。
  • 无真实安全扫描证据:提供的「安全认证报告」明确标注为「系统自动生成占位,未执行安全扫描」,S+/T1 的评级缺乏实证支撑。

适合人群

  • 高 stakes 代码/技能维护者:需要审计级可追溯性的关键基础设施维护者。
  • 多模型编排开发者:正在构建 DeepSeek/Qwen/本地模型混合工作流的工程师。
  • OpenClaw 生态贡献者:需要确保技能在特定运行时中真实可用而非理论上兼容。
  • 厌恶「感觉对了就发布」的保守派工程文化:适合对「收敛」有严格定义、需要强制停止规则(stop-rule)的团队。

常规风险

1. 形式主义陷阱:操作者可能机械执行三步结构但填充空洞内容,沦为「结构化表演」。
2. 回滚疲劳:高频验证失败-回滚循环可能导致开发速率骤降,团队可能绕过验证机制。

3. 持久会话污染multi 模式下若恢复机制失效,可能积累跨轮次幻觉,且因「禁止开新聊天」规则而难以摆脱。

4. 趋势锁的时效幻觉:两轮互联网扫描的最小地板仅确保「检查过」,不保证「检查对了」——外部证据可能被误读或快速过时。

5. OpenClaw 锁的可达性问题:若本地 OpenClaw 运行时表面确实不可用,强制检查可能导致任务阻塞,需显式降级到 theoretical-provisional 状态,但操作者可能因面子问题不愿标注。

安全解读

核心用法

Dual-Thinking是一套系统化的AI技能工程方法论,采用"双模型咨询+自动升级"的核心架构。其运行时遵循严格的SELF_POSITIONCONSULTANT_POSITIONSYNTHESIS三阶段顺序:主Agent首先形成独立立场,然后咨询外部模型获取第二意见,最终主Agent拥有综合决策权并执行最终判断。

该技能通过Deterministic Router智能路由任务类型,支持六种核心模式:skill-rewrite(技能重写)、skill-hardening(安全加固)、skill-publish-readiness(发布准备)、weak-model-optimization(弱模型优化)、skill-review(技能审查)和general-decision-review(通用决策)。特别设计了multi模式实现多编排器交替咨询,每轮切换不同模型以保持思维多样性。

执行过程中严格遵守Runtime Core Lock约束,包括上下文隔离规则(外部模型默认不可见,必须通过显式粘贴传递信息)、持久化会话规则(禁止无故创建新聊天会话)、状态原子转换规则(验证失败立即回滚)以及用户声明轮次承诺(必须完成用户预设的轮次计划)。

显著优点

结构化决策质量:通过强制性的三阶段分离,避免了单一模型的认知偏见和过度自信,显著提升了复杂技能工程决策的可靠性。

安全机制完善:内置多层安全锁机制——运行时核心锁确保执行顺序不可绕过,状态转换与回滚门保证补丁失败时的原子回退,恢复决策树提供标准化的故障处理路径,上下文隔离稳定性锁杜绝了信息泄露风险。

自进化能力:Self-evolution Lock激活时,系统会以"外部视角"审视自身,主动寻找结构性简化、压缩、重排序或删除的机会,优先目标导向而非形式保留,实现了真正的自我改进而非表面修饰。

当前日期趋势感知:Current-date Internet Trend Grounding Lock强制在有关当前最佳实践的任务中,必须通过互联网调研获取最新公开证据,避免依赖模型内部陈旧知识,确保技能工程紧跟技术发展前沿。

OpenClaw运行时接地:针对OpenClaw平台优化的技能,必须检查真实本地运行时表面,而非仅凭通用代理理论推断,确保平台适配性声明的真实性。

潜在缺点与局限性

执行开销较高:完整的三阶段流程加上严格的验证、回滚、状态同步机制,对于简单任务可能显得过度设计。文档明确建议:对于1小时内可逆、低风险、小变更且无实质权衡不确定性的操作,应直接执行而非启用完整Dual-Thinking循环。

上下文管理复杂:严格的上下文隔离规则要求开发者手动管理大量信息传递,在多轮咨询中需要反复粘贴前文内容,增加了操作负担和出错概率。

弱模型兼容性挑战:虽然提供了Compact咨询结构作为弱模型回退方案,但当模型无法维持结构化输出或会话稳定性时,整个方法论的效果会显著下降。

依赖外部咨询可用性:在apimulti模式下,系统有效性高度依赖外部咨询模型的可用性和响应质量,若遭遇服务中断或质量下降,需要执行复杂的恢复流程。

学习曲线陡峭:文档长达3500+行,包含大量嵌套规则、锁机制和边界条件,新用户需要较长时间才能掌握正确的使用方式,容易因误解规则而导致执行失败。

适合的目标群体

AI技能开发者:需要将技能从原型推向生产就绪状态的专业开发者,特别是面临技能审查、安全加固、发布准备等关键里程碑时。

Agent系统架构师:设计复杂多Agent协作系统的工程师,需要标准化的决策协调机制和故障恢复流程。

质量敏感型团队:对AI生成内容的可靠性有严格要求的企业团队,愿意 trade-off 效率以换取更高的输出质量保障。

OpenClaw平台用户:专门为该平台开发或优化技能的开发者,可利用内置的OpenClaw运行时接地机制确保平台适配性。

研究方法学爱好者:对结构化决策流程、认知偏见缓解、系统工程方法论感兴趣的研究者和实践者。

使用风险

性能风险:严格的轮次承诺和禁止早期停止规则可能导致过度执行——即使当前产出已足够好,仍需完成用户预设的全部轮次,造成Token和时间浪费。

状态同步风险STATE_SNAPSHOTSYNC_POINTRESUME_SNIPPET等状态 artifact 必须精确描述最新接受状态,若开发者手动操作时出现版本错位,可能导致恢复后基于错误状态继续执行。

咨询质量依赖风险CONSULTANT_QUALITY: failedweak时虽有降级机制,但频繁的咨询失败会显著降低方法论价值,转为analysis-only模式后实质上退化为单模型决策。

规则冲突解释风险:文档存在大量"如果冲突,更严格解释获胜"的条款,但在实际复杂场景中,何种解释"更严格"可能存在主观判断空间,导致执行歧义。

工具链依赖风险:当前为纯文档型技能(无实际可执行代码),所有规则依赖主Agent的自觉遵守。若宿主系统未正确实现Runtime Core Lock的强制执行机制,文档约束可能沦为建议而非约束。

版本漂移风险:文档强调reference/文件不得覆盖inline运行时契约,但长期维护中reference文件与主文档的同步需要额外注意,否则可能产生实践与文档的分歧。

Dual Thinking 内容

references文件夹
scripts文件夹
tests文件夹
fixtures文件夹
手动下载zip · 83.6 kB
backlog-next-line.mdtext/markdown
请选择文件