Skill

🐕 Claude API 实时监控与告警

零成本监控Claude API状态与延迟,通过Telegram实时推送故障告警与恢复通知。

收藏
4.2k
安装
1.3k
版本
1.2.0
CLS 安全扫描中
预计需要 3 分钟...

使用说明

核心用法

Claude Watchdog 是一款面向 Claude API 用户的监控工具,通过本地部署的 Python 脚本实现双重监控机制:

1. 状态监控 (status-check.py):每15分钟轮询 Anthropic 官方状态页 (status.claude.com),抓取服务中断事件、组件状态及最新更新,支持按模型过滤(如仅关注 Sonnet 相关故障),零 Token 消耗。

2. 延迟探测 (latency-probe.py):每15分钟通过本地 OpenClaw 网关发送真实 API 请求,测量端到端延迟,基于滚动中位数基线(默认20个样本)智能分级告警(🟡轻微软化/🟠显著延迟/🔴严重故障),单次探测成本约 $0.000001。

安装采用交互式脚本自动化完成:配置环境变量、写入 cron 定时任务、执行初始检测。配置集中存储于 ~/.openclaw/skills/claude-watchdog/,支持热更新。

显著优点

  • 成本极低:状态检查完全免费,延迟探测单次成本可忽略
  • 告警精准:智能过滤无关模型故障,延迟分级基于动态基线而非固定阈值
  • 恢复闭环:自动发送恢复通知,避免人工确认
  • 零依赖:纯 Python 标准库,无需 pip 安装
  • 本地优先:网关探测反映真实网络路径,比官方状态页更贴近用户体验

潜在局限

  • 依赖 OpenClaw 生态:延迟探测需本地 OpenClaw 网关运行,增加架构复杂度
  • Telegram 单一渠道:未内置邮件、Slack、PagerDuty 等企业级告警通道
  • 无历史分析:仅保留滚动窗口数据,缺乏长期趋势图表与容量规划支持
  • 单点故障风险:网关宕机将导致延迟探测失效,需额外监控网关本身
  • 权限敏感:配置文件含 Telegram Bot Token 和网关认证密钥,需手动确保 600 权限

适合人群

  • 重度依赖 Claude API 的开发者/团队,需第一时间感知服务降级
  • 已有 OpenClaw 部署环境,希望扩展可观测性栈的用户
  • 成本敏感型用户,拒绝 SaaS 监控服务的订阅费用
  • Telegram 重度用户,偏好即时通讯推送

常规风险

| 风险类型 | 说明 | 缓解建议 |
|---------|------|---------|
| 凭证泄露 | `.env` 文件含敏感 Token,权限配置不当可能导致未授权访问 | 严格遵循 `chmod 600`,避免版本控制提交 |
| 误报疲劳 | 网络抖动或网关负载波动可能触发短暂告警 | 调整 `ALERT_MULTIPLIER` 和 `RECOVER_MULTIPLIER` 阈值 |
| 探测盲区 | 网关故障时延迟探测失效,可能遗漏真实 API 问题 | 叠加官方状态监控作为交叉验证 |
| 数据持久化 | 状态文件长期运行可能累积,需关注磁盘空间 | 定期清理或轮转日志文件 |

Skill 内容

scripts文件夹
手动下载zip · 12.3 kB
latency-probe.pytext/plain
请选择文件