CnOps 智能运维与可观测社区
首页开源项目实践文章视频课程常见问答开发者工具STAROps 专题
导航菜单
首页开源项目实践文章视频课程常见问答开发者工具STAROps 专题

CnOps 智能运维与可观测社区

愿景

CnOps 智能运维与可观测社区是一个以"智能运维与可观测"为核心的开放、包容、分享的技术社区,旨在聚集运维专家、开发者和爱好者,共同探讨、学习和分享可观测最佳实践与最新技术,与众多技术社区合作互动,共同探讨交叉领域的技术挑战,推动可观测领域的创新与进步。

内容社区

  • 实践文章
  • 视频课程
  • 开源项目
  • 常见问答
  • 开发者工具

友情链接

  • Prometheus
  • Grafana Lab
  • OpenTelemetry
  • LoongCollector

关注我们

阿里云云原生公众号阿里云云原生
阿里云可观测公众号阿里云可观测

Copyright © 2026 CnOps 社区. All rights reserved.

首页问答OpenAPI 网关监控中,Checkpoint 为什么选择「At-Least-Once + 允许失败」而不是标准 Exactly-Once?

OpenAPI 网关监控中,Checkpoint 为什么选择「At-Least-Once + 允许失败」而不是标准 Exactly-Once?

#Checkpoint#Exactly-Once#AT-LEAST-ONCE#Flink 调优#高可用

agenticOps | 2026-05-23

作者在实践中提供了两套 Checkpoint 策略,供不同业务权衡:

  • 策略 A(标准 Exactly-Once):checkpointing.interval=60s、mode=EXACTLY_ONCE、timeout=10min。适合计费、审计等强一致场景。
  • 策略 B(本案例生产使用):interval=180s、mode=AT_LEAST_ONCE、timeout=15min、tolerable-failed-checkpoints=10。

选择策略 B 的原因是 OpenAPI 网关属于「超高并发 + 极度重视可用性」的场景:

  • 频繁 Checkpoint 会带来 Barrier 对齐停顿,抖动直接影响吞吐。
  • Exactly-Once 需要对齐 Barrier,在大状态下开销显著。
  • 监控数据的价值主要在趋势和秒级告警,允许极少量重复不会影响业务决策。
  • 允许连续失败可防止因 Checkpoint 短暂问题触发作业重启导致的漏点。

因此该场景采用「弱一致性 + 低频打点 + 允许失败」的组合,在可靠性和稳定性之间取得平衡。

推荐文章

超过 2000+ 位开发者正在阅读

给 OpenClaw 加上企业级 Memory

给 OpenClaw 加上企业级 Memory

4646 阅读

阿里云 STAROps 全域智能运维平台发布!

阿里云 STAROps 全域智能运维平台发布!

3453 阅读

阿里云正式发布 RCA Benchmark

阿里云正式发布 RCA Benchmark

2716 阅读

推荐视频

UModel 最佳实践 Vol.1 UModel 数据建模全景解读

UModel 最佳实践 Vol.1 UModel 数据建模全景解读

3854 观看50:35
云监控2.0全景:可观测范式升级与智能运维蓝图

云监控2.0全景:可观测范式升级与智能运维蓝图

2532 观看41:06

推荐工具

精选可观测领域开发者工具

云监

云监控 2.0 沙箱体验

7483 使用

免费

免费网络拨测工具

2746 使用