新版日志聚类通过 SLS SPL 算子构建了三阶段聚类流水线:
第一阶段——模型构建:使用 get_log_patterns 算子对采样日志进行模式提取。算法参数包括 threshold(变量判定最小支持度)、tolerance(变量识别容忍度)、maxDigitRatio(数字字符最大比例)。采样 5 万条即可发现绝大多数模式。
第二阶段——模式匹配:使用 match_log_patterns 将每条日志与已发现模式匹配,提取 pattern_id、pattern(模板)、pattern_regexp(正则)和 variables(变量取值),再进行统计计数和时间分布直方图。采样 20 万条进行统计。
第三阶段——对比分析(可选):使用 merge_log_patterns 将两个时间段的聚类模型合并,在统一模式空间中进行对比,发现新增、消失或变化的日志模式。
三阶段分层设计让系统在海量数据下仍能保持秒级响应。




