核心用法
故障处理 Skill 是纯 Python 实现的运维自动化工具,通过 run-script API 在远程主机执行脚本,并轮询 execution-history API 获取执行结果。完整流程包括:确认执行参数(主机IP、脚本ID/内容、组织信息)→ 调用 API 提交任务 → 轮询等待执行完成 → 输出结构化执行报告。
支持两种脚本来源:预置脚本(如nginx重启、磁盘清理)或自定义脚本内容。多主机并行执行,逗号分隔IP即可。脚本内置300秒超时保护,防止无限轮询。
显著优点
1. 纯Python实现:无Node/TS依赖,环境要求低,部署简单
2. 闭环执行流程:提交-轮询-报告全自动,无需人工介入等待
3. 结构化输出:JSON格式结果包含逐主机状态、stdout、耗时等完整信息
4. 灵活参数支持:支持脚本ID复用或临时脚本内容,适应多样化场景
5. 内置安全超时:5分钟轮询上限,避免资源占用
潜在缺点与局限性
1. 同步阻塞设计:轮询期间脚本持续运行,无法并发处理其他任务
2. 无重试机制:API错误直接报错退出,网络抖动敏感
3. 主机IP强依赖:必须显式确认,无法自动发现或模糊匹配
4. 预置脚本有限:仅2个内置脚本,复杂场景需自行准备脚本内容
5. 环境变量硬编码:配置固定从.env读取,不支持运行时动态配置
适合人群
- 中小规模运维团队(主机数<100)
- 需要快速故障响应但不想搭建重量级运维平台的场景
- 熟悉Linux命令行的运维工程师
- 临时性、低频次的自动化任务需求
常规风险
- 误操作风险:远程执行脚本可能引发服务中断,需严格确认主机IP和脚本内容
- 权限风险:API调用依赖
LWJK_API_SECRET,泄露可导致未授权主机访问 - 网络风险:轮询机制在弱网环境可能超时误判
- 单点故障:无分布式执行能力,脚本运行机宕机则任务失控