随着业务全面上云和微服务架构的普及,我们正迎来一个"大观测"的时代——系统的每一个角落都在产生海量的指标数据(Metrics),它们是衡量系统健康度的关键。然而,数据的极大丰富也带来了新的困境——"指标洪水"。运维团队和 SRE 工程师们发现自己被淹没在无穷无尽的监控大盘和告警信息中,患上了"告警&大盘疲劳症"。传统监控的本质局限:传统监控系统本质上是"数据展示平台",能够准确地将数据从时序数据库中取出、绘制成曲线呈现给用户,这种模式隐含了一个关键假设——用户知道应该看什么,并且能够从纷繁复杂的曲线中自行解读出问题根源。在系统规模尚小、维度较少时这套方法尚能奏效,但今天一个服务动辄拥有成百上千个实例、每个实例又有数十个维度的标签(地域、可用区、版本号等),一个指标背后是数万甚至数百万条独立的时间序列。分析赤字:当问题发生时,依赖人眼去逐一排查,无异于大海捞针——拥有海量数据,却缺乏从中高效提取有效信息的能力,这就是"分析赤字"。




