新版日志聚类的核心思想是让机器自动从海量日志中发现模式。其基于一个关键洞察:虽然日志量巨大,但通常由有限数量的日志输出语句产生,每个语句产生的日志格式相同,可用同一个日志模板表示。
例如三条日志 Got exception while serving block-123/456/789 to /10.251.203.149/150/151 可以归纳为一个模板:Got exception while serving to /,其中 BLOCK_ID 和 IP 是变量,其余是常量。
通过这种抽象,成千上万条日志被压缩为少量日志类别。工程师先在模板层面定位问题,再深入查看具体样例。这是从逐条查看到类别化分析的认知升级,将排查效率从小时级缩短到分钟级。