Lerwee Alert To Fault Handling

🔧 智能告警自动匹配,一键故障处理

智能告警自动处理工作流,通过上下文识别自动匹配故障脚本,支持一键执行与日志审计,提升运维响应效率。

收藏
3.6k
安装
1.4k
版本
1.0.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

alert-to-fault-handling 是一款面向运维场景的智能告警处理工作流技能。其核心机制是监听对话中的告警上下文(eventid、IP、告警名称),通过群组识别与关键词匹配,自动推荐对应的故障处理脚本,引导用户一键执行。

工作流程遵循:告警检测 → 群组/分类匹配 → 脚本推荐 → 用户确认 → 执行脚本 → 结果反馈的闭环。用户可通过回复「执行」「确认」等指令触发预置脚本(如 nginx 重启、磁盘清理),也可手动指定 script_id 执行特定脚本。

显著优点

1. 上下文感知自动化:无需手动查询,自动从告警消息中提取 IP、eventid 等关键信息,减少信息录入错误
2. 精准匹配机制:支持多级匹配(群组 → 分类 → 关键词),确保推荐脚本的针对性

3. 完整的审计链路:所有执行记录到 .execution_log.json,包含时间戳、执行人、状态、输出详情,满足合规要求

4. 灵活的扩展性:通过修改 .scripts_map.json 即可添加新脚本类型,无需改动核心逻辑

5. 可选的告警闭环:执行成功后支持自动关闭对应告警,减少人工干预

潜在缺点与局限性

1. 依赖预置配置:新告警类型需提前配置 scripts_map,无法自动适配未知告警
2. IP 获取存在单点依赖:若告警消息无 IP 且 objectid 查询失败,流程中断

3. 缺乏权限细粒度控制:配置文件中未体现执行权限分级(如生产环境需审批)

4. 回滚能力有限:仅支持查询历史结果,无自动回滚机制

5. 多主机并发场景未明确:示例均为单 IP 执行,批量主机处理逻辑未详述

适合人群

  • 运维工程师/SRE:需要快速响应常规告警(nginx、磁盘、数据库等)
  • 值班人员:通过飞书群接收告警,希望一键处理减少登录跳板机操作
  • 中小规模技术团队:告警类型相对标准化,有精力维护 scripts_map 配置

常规风险

| 风险类型 | 说明 | 缓解措施 |
|---------|------|---------|
| 误执行风险 | 关键词匹配错误导致执行错误脚本 | 强制用户二次确认,白名单机制 |
| 生产事故 | 重启类脚本在高峰期执行导致服务中断 | 建议配置执行时间窗口(未实现) |
| 日志篡改 | 本地 json 日志文件可被手动修改 | 建议接入中心化日志系统 |
| API 泄露 | `lerwee-api.sh` 脚本可能包含敏感凭证 | 需确保脚本权限与密钥管理 |

安全等级评估

  • 用户确认机制:强 ✅ 必须回复明确指令方可执行
  • 输入校验:中等 ⚠️ IP 依赖外部查询,存在失败场景
  • 权限隔离:弱 ❌ 未体现用户角色与脚本权限的映射
  • 审计完整性:强 ✅ 执行链路全记录

综合评估:适合标准化告警场景,生产环境建议补充执行时间窗口、权限分级、中心化日志等增强措施。

Lerwee Alert To Fault Handling 内容

手动下载zip · 10.7 kB
.execution_log.jsonapplication/json
请选择文件