功能概述
Grafana Lens 是一套面向 Grafana 生态的完整数据可视化和监控技能,提供从数据查询到仪表盘创建、从告警配置到安全审计的全链路能力。该技能深度整合了 Prometheus、Loki、Tempo 三大可观测性数据源,支持 PromQL、LogQL、TraceQL 三种查询语言,适用于指标监控、日志分析、分布式追踪等多种场景。
核心能力
数据查询层:提供 grafana_query(PromQL 即时/范围查询)、grafana_query_logs(LogQL 日志搜索)、grafana_query_traces(TraceQL 链路追踪)三大查询工具,支持面板级查询复用、自动步长计算、字段提取等高级特性。
可视化层:支持通过预置模板(如 llm-command-center、session-explorer、cost-intelligence 等 12 种模板)快速创建仪表盘,或自定义 JSON 构建个性化面板。提供仪表盘审计、更新、分享等完整生命周期管理。
告警与通知:支持创建 Grafana 原生告警规则,内置 webhook 自动配置,提供告警确认、静默、规则列表查询等运维能力,并包含告警疲劳分析功能。
安全与审计:专设 grafana_security_check 运行 6 项并行安全检查(webhook 错误率、成本异常、工具循环、注入信号、会话枚举、卡死会话),输出绿/黄/红三级威胁评估。
数据接入:通过 OTLP 协议支持自定义指标推送(健身、财务、日历等),支持历史数据回填和自动指标注册。
智能调查:grafana_investigate 提供多信号联合调查能力,并行采集指标、日志、链路追踪和上下文信息,生成带置信度的假设和可执行的验证路径。
显著优势
1. 查询语言原生支持:正确处理 PromQL/LogQL/TraceQL 的语义差异,自动识别数据源类型并路由至正确工具,避免查询语言误用。
2. 模板化快速部署:12 种专业模板覆盖 AI 可观测性(GenAI)、SRE 运维、成本分析、会话调试等场景,支持模板链式推荐。
3. 智能辅助决策:grafana_explain_metric 自动识别计数器/仪表盘类型,提供趋势分析、异常检测(z-score)、周期对比和维度拆解建议。
4. 跨信号关联:内置日志-链路追踪关联能力(correlationHint、traceCorrelation),支持从日志跳转到链路、从告警跳查到根因的标准化调查流程。
5. 零配置数据发现:grafana_explore_datasources 自动发现数据源 UID 和查询路由信息,消除手动配置负担。
潜在局限
1. 认证层盲区:明确声明无法检测网关层的认证失败(错误令牌、暴力破解、速率限制锁定),仅监控可观测信号而非安全边界。
2. 数据源依赖:功能完整度取决于 Grafana 实例配置的数据源类型(Prometheus/Loki/Tempo 缺一则对应能力降级)。
3. 渲染插件依赖:仪表盘图片分享功能需 Grafana Image Renderer 插件支持,缺失时降级为快照或链接。
4. 历史数据限制:计数器类型指标不支持时间戳回填,仅仪表盘类型支持历史数据推送。
适用人群
- SRE/运维工程师:RED/USE 方法学实践、告警疲劳分析、事后复盘生成
- AI/LLM 应用开发者:GenAI 可观测性、token 成本归因、会话级调试、链路追踪
- 平台工程师:自定义仪表盘构建、多租户监控配置、安全态势感知
- 数据分析师:自定义指标接入、业务 KPI 可视化、周期性报告自动化
风险等级评估
- 操作风险:中等(
update_dashboard的delete操作和delete_rule为永久删除,需用户确认) - 数据泄露风险:低(仪表盘分享生成的是渲染图片或内部快照,不包含原始数据导出)
- 权限风险:中等(告警配置影响通知渠道,静默操作可能掩盖真实故障)
- 审计建议:关键删除操作前强制用户确认,告警静默建议设置过期时间,定期审查
list_rules输出中的异常状态规则