当日志量特别大时(如数千万条),新版日志聚类内置了分层采样策略:
- 模式发现阶段:采样 5 万条日志用于发现模式。因为日志模式数量远小于日志总数(这是聚类的基本假设),5 万条通常足以发现绝大多数模式。
- 模式匹配阶段:采样 20 万条进行统计。影响的是数量统计精度,而非模式发现。
- 变量统计阶段:每个模式保留 Top 10 变量取值,足以让用户理解分布特征。
采样算法采用伯努利采样(Bernoulli Sampling),确保每条日志被选中的概率相等,保证代表性。当日志量超过阈值时自动降采样。
实践表明这种策略在绝大多数场景下能提供足够准确的聚类结果,同时保持秒级查询响应,不会显著影响聚类效果。




