通过链路及其关联数据可以快速定位错慢请求的异常对象,但导致问题发生的真实根因往往更加复杂,不局限于应用进程内。为了快速止血或彻底根治,需要采集更大范围的观测数据,并通过统一实体模型构建异常对象与根因之间的联系。
- 最简单常见的实体关联:相同时间范围内、同一台主机实例的数据关联。比如某台物理机出现硬件故障,故障期间没有及时切流导致路由到该机器的所有流量全部超时报错。以 Java 应用为例,ARMS 提供主机/Pod 系统指标、JVM GC/堆内存、线程池/连接池等丰富的主机监控数据用以诊断单机问题。
- 更广义的实体关联:还包括移动终端、网关、数据库、K8S 工作负载、CI/CD 任务甚至 Git 代码提交人。这些跨域实体及其关系构建了一张覆盖端到端全栈 IT 软硬件设施的数据观测网络。
任意实体的变化会导致上下游关联实体的联动反应,例如某同学执行了一次数据库索引变更,导致某应用出现大量慢 SQL,进而影响终端用户下单失败。通过构建统一实体关系模型,可以打通跨域数据连接壁垒,提升根因诊断效率,并为智能诊断打下坚实基础。




