智能根因诊断不是一个新概念,学术和工业界都有大量探索,但只要技术还在迭代、线上系统还存在稳定性风险,它就是一个历久弥新的课题。相比以往,当下有两个显著变化带来了新的尝试机会:
- 更大范围更高质量的数据采集:随着可观测技术迭代与开源标准统一,可以采集到更丰富的全栈观测数据(比如车机终端、4 层网络、系统内核等)。以 OpenTelemetry 为代表的可观测数据标准逐步被更多开发者和厂家接受,数据孤岛被逐步破除(比如基于 W3C 标准实现端到端全链路追踪)。高质量数据就像新鲜食材,是做成智能根因诊断的基础。
- 大语言模型带来的算法革新:传统基于规则的根因诊断难以泛化到通用场景(如慢 SQL 语法优化),基于概率统计的算法则有较大不确定性与算力瓶颈。基于 LLM Multi-Agent 有希望取得更好效果——利用大模型提升人机交互体验与通用领域问题解答,结合 RAG 运维领域知识库解决模型精度或幻觉问题,通过 Workflow 模型编排实现整体任务的拆解、剪枝与执行。




