阿里云 ARMS 结合近十年 APM 领域产品研发与客户支持经验,总结沉淀了一套行之有效的错慢请求根因诊断方案,整体可分为三个递进的层次:
- 第一层:根据 Trace 链路及关联数据定位错慢请求异常对象。链路追踪可以跟踪一次请求在分布式系统中的流转路径与状态,同时将请求过程中的日志、方法栈、出入参、异常堆栈等数据精准关联,实现异常代码行级定位。比如用户在 APP 下单超时,通过前后端链路追踪结合方法栈,最终定位到 A 应用 B 接口 C 方法耗时超过 3s。
- 第二层:根据异常对象关联的实体数据分析真实根因。代码执行报错或缓慢只是表象,导致变化的原因可能是一次未经灰度验证的应用发布、底层基础设施故障,或业务流量突增导致共享资源不足。这些信息与异常对象存在直接或间接关联,需要构建更广泛的跨域实体关联才能完成深层次定位。
- 第三层:高质量数据+领域知识+大模型算法实现智能根因诊断。构建统一可观测平台实现端到端全栈数据采集,遵循一套语义构建统一实体关系模型,再结合 LLM 大模型编排与领域知识库,最终实现面向错慢诊断等经典运维场景的自动化归因。




