Restart Safe Workflow

🔄 网关零中断安全重启工作流引擎

专为 OpenClaw 网关设计的零中断安全重启方案,通过 doctor 预检、checkpoint 保存、健康检查与任务续跑机制,确保服务重启期间业务零感知。

收藏
2.4k
安装
1k
版本
1.0.2
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心能力

restart-safe-workflow 是一套面向 OpenClaw 网关的企业级安全重启工作流引擎,核心设计遵循"先保全、后执行、再恢复"的韧性原则。

主链路:六步闭环

完整的安全重启链条为:
1. doctor — 前置健康诊断,识别潜在风险

2. checkpoint — 状态快照与上下文持久化

3. restart — 受控网关重启操作

4. health — 重启后健康探活验证

5. resume — 任务状态机恢复与续跑

6. notify — 用户可见通知(支持 notify-time[:TZ] 语义)

任务续跑机制

依托 pendingActions 队列与 Action 状态机,实现断点续传。即使重启过程中断,系统也能从 checkpoint 恢复上下文,避免任务丢失或重复执行。

计划与校验能力

  • plan 模式:预览执行路径,输出 dry-run 报告
  • validate 模式:基于 TaskPlan v1 Schema 校验任务配置合法性

补偿与异常升级

内置 reconcile 协调器处理状态漂移,当重试次数超过阈值时触发 retry_exceeded 升级通道,确保故障可观测、可干预。

显著优势

  • 零业务中断:checkpoint/resume 机制保障 inflight 请求不丢失
  • 可观测性强report --verbosediagnose 提供全链路追踪
  • 自动化验收restart-acceptance.sh 支持自守护 detached 模式,一键完成回归验证
  • 配置即代码:JSON Schema 约束,CI 友好

潜在局限

  • 强依赖 OpenClaw 网关架构,异构环境需适配层
  • checkpoint 数据量大时可能引入短暂延迟
  • 时区语义 notify-time[:TZ] 需确保节点时钟同步

适用场景

  • 云原生网关滚动升级与配置热更新
  • 金融级高可用场景下的受控维护窗口
  • 需要任务状态机保证的长时间运行工作流

风险提醒

  • 生产环境首次启用前,务必通过 validate 校验任务计划
  • 验收脚本默认 detached 模式,需关注日志轮转与磁盘空间
  • 升级触发器(TC10)在 v1.0.2 修复,旧版本存在误触发风险

Restart Safe Workflow 内容

references文件夹
scripts文件夹
手动下载zip · 18.9 kB
restart-safe-sop.mdtext/markdown
请选择文件