CnOps 智能运维与可观测社区
首页开源项目实践文章视频课程常见问答开发者工具STAROps 专题
导航菜单
首页开源项目实践文章视频课程常见问答开发者工具STAROps 专题

CnOps 智能运维与可观测社区

愿景

CnOps 智能运维与可观测社区是一个以"智能运维与可观测"为核心的开放、包容、分享的技术社区,旨在聚集运维专家、开发者和爱好者,共同探讨、学习和分享可观测最佳实践与最新技术,与众多技术社区合作互动,共同探讨交叉领域的技术挑战,推动可观测领域的创新与进步。

内容社区

  • 实践文章
  • 视频课程
  • 开源项目
  • 常见问答
  • 开发者工具

友情链接

  • Prometheus
  • Grafana Lab
  • OpenTelemetry
  • LoongCollector

关注我们

阿里云云原生公众号阿里云云原生
阿里云可观测公众号阿里云可观测

Copyright © 2026 CnOps 社区. All rights reserved.

首页问答Flink 作业的 Checkpoint 配置在高可用监控场景如何选择?

Flink 作业的 Checkpoint 配置在高可用监控场景如何选择?

#Checkpoint#Flink#高可用#Exactly-Once#监控

CNOps | 2026-03-19

Flink Checkpoint 配置需根据业务对数据一致性与服务可用性的偏好进行选择,有两种典型策略:

策略 A:标准一致性优先(通用场景)

SET 'execution.checkpointing.interval' = '60s';
SET 'execution.checkpointing.mode' = 'EXACTLY_ONCE';
SET 'execution.checkpointing.timeout' = '10min';

适用于计费、审计等对数据准确性有严格要求的场景。需要对齐 Barrier,开销中等。

策略 B:高可用优化(超大规模监控)

SET 'execution.checkpointing.interval' = '180s';
SET 'execution.checkpointing.mode' = 'AT_LEAST_ONCE';
SET 'execution.checkpointing.timeout' = '15min';
SET 'execution.checkpointing.tolerable-failed-checkpoints' = '10';

适用于超高并发且对可用性极度敏感的监控场景。采用弱一致性 + 低频打点 + 允许失败的组合策略,避免 Checkpoint 过于频繁导致的性能抖动,不因 CP 失败重启作业。适合实时大屏和趋势分析场景。

推荐文章

超过 2000+ 位开发者正在阅读

给 OpenClaw 加上企业级 Memory

给 OpenClaw 加上企业级 Memory

4646 阅读

阿里云 STAROps 全域智能运维平台发布!

阿里云 STAROps 全域智能运维平台发布!

3453 阅读

阿里云正式发布 RCA Benchmark

阿里云正式发布 RCA Benchmark

2716 阅读

推荐视频

UModel 最佳实践 Vol.1 UModel 数据建模全景解读

UModel 最佳实践 Vol.1 UModel 数据建模全景解读

3854 观看50:35
云监控2.0全景:可观测范式升级与智能运维蓝图

云监控2.0全景:可观测范式升级与智能运维蓝图

2532 观看41:06

推荐工具

精选可观测领域开发者工具

云监

云监控 2.0 沙箱体验

7483 使用

免费

免费网络拨测工具

2746 使用