error-guard

🛡️ 系统级防死锁安全控制中枢

OpenClaw官方系统级控制平面技能,通过非阻塞命令防止代理死锁冻结,保障长时任务安全运行与紧急恢复。

收藏
4.5k
安装
2.1k
版本
v1.0.0
CLS 安全性认证2026-07-07
点击查看完整报告 >

使用说明

核心用法

error-guard 是 OpenClaw 的系统级控制平面安全技能,专为解决代理长时间运行任务时的死锁、冻结和不可恢复状态而设计。它提供三个核心命令:

  • /status:实时报告系统健康状态和任务注册表,返回活跃任务列表、启动时间、最后心跳及停滞标记,且必须在常数时间内完成,不调用任何模型或外部 API。
  • /flush:紧急停止命令,立即取消所有活跃任务、终止执行会话、清空消息队列并重置内存中的任务注册表,确保在任何情况下都能响应。
  • /recover:安全恢复序列,依次执行 flush、重置控制平面状态,并可选择性地重新加载技能状态而无需重启容器。

该技能采用事件驱动架构,主代理永不阻塞,所有操作均为非 LLM 控制命令,适用于长时任务、子代理、基准测试、后台监控等场景。

显著优点

1. 故障安全优先:所有恢复命令设计为必须响应,即使在系统濒临冻结时也能执行紧急操作。
2. 零数据风险:明确不存储任何 payload、提示词、消息内容或模型输出,仅保留 taskId、时间戳和状态等最小元数据。

3. 架构简洁可靠:遵循最小状态原则,无业务逻辑、无后台轮询、无用户界面,专注于单一职责。

4. 性能保障:状态查询和紧急操作均为常数时间复杂度,不会因系统负载增加而降级。

潜在缺点与局限性

1. 高级用户门槛:SKILL.md 明确警告此为系统级技能,需要理解 OpenClaw 执行模型才能正确安装和使用。
2. 功能范围受限:作为"最后一道防线",刻意保持极简,不提供业务逻辑或用户-facing 功能。

3. 依赖外部 SDK:核心功能依赖 @openclaw/sdk 的 process、sessions 等 API,其安全行为需单独确认。

4. 未来扩展未实现:子代理运行辅助、任务看门狗、结构化事件协议等功能尚处于规划阶段。

适合的目标群体

  • 运行长时任务或高风险工作负载的 OpenClaw 高级用户
  • 需要实现子代理、基准测试或后台监控系统的开发者
  • 追求系统稳定性、需要紧急恢复能力的企业运维团队
  • 对代理控制平面有深度定制需求的技术架构师

使用风险

1. flush 操作的数据丢失风险:紧急停止会无条件终止所有活跃 exec 会话,未保存的工作进度将丢失。
2. SDK 依赖的供应链风险:@openclaw/sdk 的安全更新和版本兼容性需要持续关注。

3. 误操作风险:/flush 和 /recover 为破坏性操作,缺乏二次确认机制,需确保调用方有适当的权限控制。

4. 状态文件权限:state.json 持久化文件建议设置 0o600 权限,当前实现未明确限制访问权限。

安全解读

核心用法

error-guard 是 OpenClaw 的控制平面安全基座,专用于解决长时运行任务中的代理僵死、死锁与不可恢复状态问题。其核心能力通过三大非阻塞命令实现:

  • `/status`:常数时间返回系统健康快照,列出活跃任务、启动时间、最后心跳及僵死标记,全程无模型调用、无外部 I/O
  • `/flush`:紧急制动,立即取消所有任务、终止进程会话、清空消息队列、重置内存注册表——必须永远响应,绝不等待
  • `/recover`:安全恢复序列,先执行 flush,再重置控制平面状态,可选重载技能而无需重启容器

设计遵循四大原则:主代理永不阻塞、事件驱动、故障优先、最小状态追踪(仅 taskId、时间戳、状态,不存 payloads)。

显著优点

1. 零依赖纯净架构:无第三方 npm 包,仅使用 @openclaw/sdk 内部 API,依赖审计满分 100
2. 隐私合规优秀:GDPR 最小化原则,不保存用户提示、模型输出或任何敏感数据

3. 代码质量顶尖:TypeScript 类型安全,结构清晰,静态分析 95 分,行为与声明完全一致

4. 确定性紧急响应:flush/recover 命令设计为「故障安全优先」,确保极端场景下仍可操作

5. 容器级免重启恢复:避免传统容器重启带来的状态丢失与服务中断

潜在缺点与局限性

  • T3 来源可信度限制:维护者为个人开发者账号(amar1432),无组织背书,需人工代码审查后使用
  • 功能极简:无业务逻辑、无用户界面、无后台轮询,仅适合有系统级维护能力的开发者
  • 未来扩展未实现:子代理 runner、任务看门狗、结构化事件协议、背压机制等仍为路线图
  • 高级用户门槛:需理解 OpenClaw 执行模型,误用可能导致任务被意外终止

适合人群

  • 运行 Moltbook、PNR 检查等长时后台监控任务的系统运维开发者
  • 需要为高并发 benchmark 或子代理集群配置熔断与逃生机制的架构师
  • 追求容器级稳定性、无法容忍冷启动延迟的生产环境维护者

常规风险

  • 误触发 flush:紧急命令无二次确认,操作前需确认无关键任务在运行
  • T3 供应链风险:虽代码无恶意,但个人账号存在未来转移或泄露可能性,建议锁定版本并监控更新
  • SDK 上游变更:依赖 @openclaw/sdk 内部 API,若 SDK 接口变动需同步适配

整体而言,error-guard 是生产级 OpenClaw 部署的「最后一道防线」,适合作为基础设施层常驻技能。

error-guard 内容

手动下载zip · 7.2 kB
benchmark-worker.tstext/plain
请选择文件