该架构的核心目的是平衡实时性、跨域带宽与全局视图三方面诉求,具体分工如下:
- 地域内处理(Regional Processing):每个地域独立部署 Logtail + SLS Logstore + Flink Job 1。日志在本地关联 MySQL 维表并做细粒度聚合(10 秒窗口,按 Product/API/Uid 等维度),将 TB 级明细压缩为 GB 级聚合数据。
- 跨地域汇聚(Cross-Region Aggregation):各地域的 Job 2 将聚合数据转换为时序指标格式,跨域写入中心地域(如 cn-shanghai)的 SLS MetricStore,供 Grafana 统一查询与告警。
之所以不直接一层聚合有两个关键原因:一是数据倾斜——某些大产品(如 ECS)QPS 是其他产品的数千倍,直接按 Product GroupBy 会造成 Task 严重倾斜;二是带宽成本——本地先聚合可将跨域数据量降低 99% 以上。同时地域独立部署也保证了故障隔离能力。




