核心用法
Checkmate 是一个确定性 Python 编排器(scripts/run.py),采用经典的 worker-judge 双 agent 循环架构 实现任务质量的自动化把控。用户通过触发词(如 "checkmate: TASK")启动技能后,系统首先进入 intake 阶段:将用户任务转化为可量化的通过/失败标准(criteria),并支持最多 5 轮迭代精炼直至用户锁定验收标准。
随后进入 主循环阶段(默认最多 10 轮):
1. Worker 执行:生成独立 agent 会话,在完整运行时环境(含 exec、web_search、所有技能、OAuth 认证)中执行任务
2. Judge 评审:另一独立 agent 对照 criteria.md 中的标准逐项评估输出
3. 结果判定:PASS 则输出 final-output.md 并结束;FAIL 则提取差距反馈,进入 checkpoint 等待用户决策(继续/重定向/停止)
交互模式(默认)下,用户在 intake、pre-start 和每个 FAIL checkpoint 均可介入审查;批处理模式(--no-interactive)则全程自主运行,适合已验证的信任环境。
显著优点
质量闭环设计:将模糊的"做好"转化为可验证的 criteria,避免"差不多就行"的交付风险,特别适合测试驱动开发、合规文档、研究综述等高标准场景。
运行时能力完整:Worker 继承 host-agent 的全部能力——代码执行、网络搜索、文件操作、Gmail/Drive 等 OAuth 技能、甚至嵌套 spawn 子 agent,复杂任务无需拆分多个技能。
恢复与审计友好:工作目录完整保留每轮迭代的 output.md 和 verdict.md,state.json 支持中断后断点续跑,便于事后复盘质量改进轨迹。
零依赖轻量化:纯 Python 标准库实现,无需 pip 安装,依赖仅 OpenClaw 平台 CLI(openclaw)和 Python 3。
潜在缺点与局限性
平台绑定过强:完全依赖 OpenClaw 专有 CLI(openclaw agent、openclaw message send等),无法迁移至其他 agent 框架或独立运行。
高权限 = 高风险:继承完整运行时意味着任务描述即代码——若描述含恶意指令或诱导性内容,worker 会直接执行危险操作(如删除文件、外发数据)。
批处理模式无护栏:--no-interactive 移除全部人工检查点,criteria 由 criteria-judge agent 自批,仅适合已知安全的任务模板。
消息截断与通知依赖:外部通知(Telegram/Signal 等)存在约 3800 字符截断,且依赖平台网关可用性;checkpoint 超时默认 60 分钟,长时任务可能因等待中断。
T3 来源需验证:个人开发者维护,无企业背书,建议社区审查后再用于生产数据。
适合的目标群体
- 研发团队:需确保代码通过测试、符合规范的自动化 CI 辅助
- 内容运营:报告、文档需达到既定质量标准的批量生产
- 研究人员:文献综述、数据收集需覆盖特定维度且无遗漏
- 自动化工程师:将"人工验收后放行"的环节纳入 agent 工作流
不适合:对来源可信度要求极高的金融、医疗合规场景;完全无人值守且输入不可信的环境。
使用风险
权限滥用风险:任务描述可被劫持执行任意命令,需像审查代码一样审查任务文本,禁止直接传递不可信第三方内容作为 checkpoint 回复。
数据泄露风险:user-input.md 和通知消息可能包含敏感信息,需在隔离工作目录(/tmp/checkmate-*)中运行,避免配置错误导致通知发送至错误 recipient。
循环耗尽风险:默认 10 轮迭代可能不足以收敛复杂任务,需根据难度调整 --max-iter;同时注意 --worker-timeout 3600s 对长耗时任务的限制。
平台依赖风险:OpenClaw CLI 版本变更或网关服务中断将直接导致技能失效。