核心功能与用法
incident-response 是一套专为 OpenClaw 生态系统设计的结构化故障响应技能,适用于配置丢失、代理路由失败、绑定变更、网关崩溃、设置消失等任何系统回退场景。该技能强制遵循 7 阶段闭环流程:
| 阶段 | 核心动作 | 关键输出 |
|:---|:---|:---|
| **Triage 分诊** | 验证故障是否真实存在 | 当前状态确认 |
| **Evidence 取证** | 从配置备份、Git 审计、会话日志、配置差异四源收集证据 | 变更时间线 + 责任人定位 |
| **5 Whys 根因** | 逐层深挖至系统级缺陷,每步必有证据支撑 | 带引证的根因链 |
| **Restore 恢复** | 基于最后正常备份执行字段级合并恢复 | 恢复确认 + 功能验证 |
| **Prevent 预防** | 按严重度添加验证脚本、Hard Rule、学习条目 | 预防提交哈希 |
| **Monitor 监控** | 部署定时巡检任务(最低7天) | 监控任务ID |
| **Document 归档** | 写入 `learnings/rules.md` 与 `MEMORY.md` | 知识沉淀 |
显著优点
- 证据驱动:禁止假设,每个结论必须引用具体文件/日志/时间戳
- 零跳过机制:7 阶段强制顺序执行,防止"快速修复"导致的复发
- 自动化集成:原生支持 Git 审计、Python 配置分析、rg 日志检索、launchctl 服务管理
- 知识复利:所有修复自动沉淀为 Hard Rule,形成组织免疫
潜在局限
- 环境依赖:深度绑定 OpenClaw 目录结构(
~/.openclaw/*),非标准部署需大量适配 - 权限要求:需要目标系统的 SSH exec 权限与 launchctl 控制能力
- 学习成本:5 Whys 方法要求操作者具备结构化根因分析训练
- 恢复风险:
--merge模式在极端并发场景下可能产生配置冲突
适用人群
- OpenClaw/Titan 服务器的运维管理员
- 负责多代理系统稳定性的 SRE/DevOps 工程师
- 需要审计"谁改了什么"的合规团队
常规风险
- 误恢复风险:若备份本身已损坏,可能将系统推向更差状态
- 监控疲劳:30 天监控期若未设置终止条件,可能产生告警噪音
- Git 历史污染:自动提交预防代码可能包含敏感路径信息
触发关键词
investigate、why did X stop working、bindings lost、gateway crashed、root cause、audit、misconfigured、agent not responding 等