Checkmate

✨ Checkmate

Checkmate

收藏
6.9k
安装
1.6k
版本
2.0.4
CLS 安全性认证2026-08-03
点击查看完整报告 >

使用说明

安全解读

核心用法

Checkmate 是一个确定性 Python 编排器(scripts/run.py),采用经典的 worker-judge 双 agent 循环架构 实现任务质量的自动化把控。用户通过触发词(如 "checkmate: TASK")启动技能后,系统首先进入 intake 阶段:将用户任务转化为可量化的通过/失败标准(criteria),并支持最多 5 轮迭代精炼直至用户锁定验收标准。

随后进入 主循环阶段(默认最多 10 轮):
1. Worker 执行:生成独立 agent 会话,在完整运行时环境(含 exec、web_search、所有技能、OAuth 认证)中执行任务

2. Judge 评审:另一独立 agent 对照 criteria.md 中的标准逐项评估输出

3. 结果判定:PASS 则输出 final-output.md 并结束;FAIL 则提取差距反馈,进入 checkpoint 等待用户决策(继续/重定向/停止)

交互模式(默认)下,用户在 intake、pre-start 和每个 FAIL checkpoint 均可介入审查;批处理模式(--no-interactive)则全程自主运行,适合已验证的信任环境。

显著优点

质量闭环设计:将模糊的"做好"转化为可验证的 criteria,避免"差不多就行"的交付风险,特别适合测试驱动开发、合规文档、研究综述等高标准场景。

运行时能力完整:Worker 继承 host-agent 的全部能力——代码执行、网络搜索、文件操作、Gmail/Drive 等 OAuth 技能、甚至嵌套 spawn 子 agent,复杂任务无需拆分多个技能。

恢复与审计友好:工作目录完整保留每轮迭代的 output.md 和 verdict.md,state.json 支持中断后断点续跑,便于事后复盘质量改进轨迹。

零依赖轻量化:纯 Python 标准库实现,无需 pip 安装,依赖仅 OpenClaw 平台 CLI(openclaw)和 Python 3。

潜在缺点与局限性

平台绑定过强:完全依赖 OpenClaw 专有 CLI(openclaw agentopenclaw message send等),无法迁移至其他 agent 框架或独立运行。

高权限 = 高风险:继承完整运行时意味着任务描述即代码——若描述含恶意指令或诱导性内容,worker 会直接执行危险操作(如删除文件、外发数据)。

批处理模式无护栏--no-interactive 移除全部人工检查点,criteria 由 criteria-judge agent 自批,仅适合已知安全的任务模板。

消息截断与通知依赖:外部通知(Telegram/Signal 等)存在约 3800 字符截断,且依赖平台网关可用性;checkpoint 超时默认 60 分钟,长时任务可能因等待中断。

T3 来源需验证:个人开发者维护,无企业背书,建议社区审查后再用于生产数据。

适合的目标群体

  • 研发团队:需确保代码通过测试、符合规范的自动化 CI 辅助
  • 内容运营:报告、文档需达到既定质量标准的批量生产
  • 研究人员:文献综述、数据收集需覆盖特定维度且无遗漏
  • 自动化工程师:将"人工验收后放行"的环节纳入 agent 工作流

不适合:对来源可信度要求极高的金融、医疗合规场景;完全无人值守且输入不可信的环境。

使用风险

权限滥用风险:任务描述可被劫持执行任意命令,需像审查代码一样审查任务文本,禁止直接传递不可信第三方内容作为 checkpoint 回复。

数据泄露风险user-input.md 和通知消息可能包含敏感信息,需在隔离工作目录(/tmp/checkmate-*)中运行,避免配置错误导致通知发送至错误 recipient。

循环耗尽风险:默认 10 轮迭代可能不足以收敛复杂任务,需根据难度调整 --max-iter;同时注意 --worker-timeout 3600s 对长耗时任务的限制。

平台依赖风险:OpenClaw CLI 版本变更或网关服务中断将直接导致技能失效。

Checkmate 内容

prompts文件夹
scripts文件夹
手动下载zip · 26.4 kB
criteria-judge.mdtext/markdown
请选择文件