Incident Response

🚨 OpenClaw 故障的七步闭环修复

面向OpenClaw系统故障的结构化应急响应流程,通过7阶段闭环(分诊→取证→5Why→恢复→预防→监控→归档)快速定位根因、修复故障并防止复发

收藏
5k
安装
1.2k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心功能与用法

incident-response 是一套专为 OpenClaw 生态系统设计的结构化故障响应技能,适用于配置丢失、代理路由失败、绑定变更、网关崩溃、设置消失等任何系统回退场景。该技能强制遵循 7 阶段闭环流程

| 阶段 | 核心动作 | 关键输出 |
|:---|:---|:---|
| **Triage 分诊** | 验证故障是否真实存在 | 当前状态确认 |
| **Evidence 取证** | 从配置备份、Git 审计、会话日志、配置差异四源收集证据 | 变更时间线 + 责任人定位 |
| **5 Whys 根因** | 逐层深挖至系统级缺陷,每步必有证据支撑 | 带引证的根因链 |
| **Restore 恢复** | 基于最后正常备份执行字段级合并恢复 | 恢复确认 + 功能验证 |
| **Prevent 预防** | 按严重度添加验证脚本、Hard Rule、学习条目 | 预防提交哈希 |
| **Monitor 监控** | 部署定时巡检任务(最低7天) | 监控任务ID |
| **Document 归档** | 写入 `learnings/rules.md` 与 `MEMORY.md` | 知识沉淀 |

显著优点

  • 证据驱动:禁止假设,每个结论必须引用具体文件/日志/时间戳
  • 零跳过机制:7 阶段强制顺序执行,防止"快速修复"导致的复发
  • 自动化集成:原生支持 Git 审计、Python 配置分析、rg 日志检索、launchctl 服务管理
  • 知识复利:所有修复自动沉淀为 Hard Rule,形成组织免疫

潜在局限

  • 环境依赖:深度绑定 OpenClaw 目录结构(~/.openclaw/*),非标准部署需大量适配
  • 权限要求:需要目标系统的 SSH exec 权限与 launchctl 控制能力
  • 学习成本:5 Whys 方法要求操作者具备结构化根因分析训练
  • 恢复风险--merge 模式在极端并发场景下可能产生配置冲突

适用人群

  • OpenClaw/Titan 服务器的运维管理员
  • 负责多代理系统稳定性的 SRE/DevOps 工程师
  • 需要审计"谁改了什么"的合规团队

常规风险

  • 误恢复风险:若备份本身已损坏,可能将系统推向更差状态
  • 监控疲劳:30 天监控期若未设置终止条件,可能产生告警噪音
  • Git 历史污染:自动提交预防代码可能包含敏感路径信息

触发关键词

investigatewhy did X stop workingbindings lostgateway crashedroot causeauditmisconfiguredagent not responding

Incident Response 内容

references文件夹
tests文件夹
手动下载zip · 13.7 kB
checklists.mdtext/markdown
请选择文件