有效的下钻顺序是四步:
- 确认指标异常——先框定时间窗口,确认活跃会话数从正常水平上升到峰值的起止时刻;
- 分析 SQL 分布——看告警时段内查询集中在哪张表、是什么查询形态;
- 追溯客户端来源——定位发起方 IP 和并发连接数;
- 定位缺失索引——判断高代价查询是否走了全表扫描。
实际案例中,活跃会话急剧上升并持续约 17 分钟后回落,大量查询集中在 inventory 表,都带有对 product_id 字段的关联子查询,客户端来源为单个 IP、共 540 个并发连接。根因是 inventory 表缺少 product_id 索引,导致每次查询都执行全表扫描,在高并发下会话快速堆积。修复动作很直接:为该表添加 product_id 索引即可。这类问题属于单实例诊断(L3),不涉及跨层传播,通常几分钟内就能出结论。




