核心能力
restart-safe-workflow 是一套面向 OpenClaw 网关的企业级安全重启工作流引擎,核心设计遵循"先保全、后执行、再恢复"的韧性原则。
主链路:六步闭环
完整的安全重启链条为:
1. doctor — 前置健康诊断,识别潜在风险
2. checkpoint — 状态快照与上下文持久化
3. restart — 受控网关重启操作
4. health — 重启后健康探活验证
5. resume — 任务状态机恢复与续跑
6. notify — 用户可见通知(支持 notify-time[:TZ] 语义)
任务续跑机制
依托 pendingActions 队列与 Action 状态机,实现断点续传。即使重启过程中断,系统也能从 checkpoint 恢复上下文,避免任务丢失或重复执行。
计划与校验能力
plan模式:预览执行路径,输出 dry-run 报告validate模式:基于 TaskPlan v1 Schema 校验任务配置合法性
补偿与异常升级
内置 reconcile 协调器处理状态漂移,当重试次数超过阈值时触发 retry_exceeded 升级通道,确保故障可观测、可干预。
显著优势
- 零业务中断:checkpoint/resume 机制保障 inflight 请求不丢失
- 可观测性强:
report --verbose与diagnose提供全链路追踪 - 自动化验收:
restart-acceptance.sh支持自守护 detached 模式,一键完成回归验证 - 配置即代码:JSON Schema 约束,CI 友好
潜在局限
- 强依赖 OpenClaw 网关架构,异构环境需适配层
- checkpoint 数据量大时可能引入短暂延迟
- 时区语义
notify-time[:TZ]需确保节点时钟同步
适用场景
- 云原生网关滚动升级与配置热更新
- 金融级高可用场景下的受控维护窗口
- 需要任务状态机保证的长时间运行工作流
风险提醒
- 生产环境首次启用前,务必通过
validate校验任务计划 - 验收脚本默认 detached 模式,需关注日志轮转与磁盘空间
- 升级触发器(TC10)在 v1.0.2 修复,旧版本存在误触发风险