持续剖析是常态化记录线程和方法级 CPU 开销的能力,弥补了传统 jstack 的历史快照缺失问题。以阿里云 ARMS 为例,典型排查流程包括:
- 发现异常:通过主机/Pod CPU 利用率监控告警识别飙升
- 定位线程池:通过线程分析监控找到 CPU 消耗最高的线程池
- CPU 热点火焰图:回溯任意时间段的 CPU 占比火焰图,直接定位性能瓶颈方法(如 CPUPressure.runBusiness() 占 99.7%)
- 差分火焰图:对比不同时间段的 CPU 开销变化,适合应用发布、大促压测场景
- Copilot 智能诊断:自动给出影响 CPU 变化的关键方法,降低对专家经验的依赖
这套流程把小时级排障压缩到分钟级。




