LLM 应用本身的复杂性引入了大量可观测诉求,因此可观测对 LLM 应用而言至关重要:
- Agent 执行过程需要详细记录:Agent 在执行任务时通常会消耗大量 token 和时间,每一步都需要详细记录,包括对模型的调用、工具的使用情况、token 消耗等都有明确需求。
- MCP Token 黑洞问题:一个 Agent 执行过程中往往需要与模型多轮交互,最终结果的 token 消耗看起来不多,但中间过程实际消耗大得惊人,甚至可能陷入无休止状态,即所谓的"MCP Token 黑洞"。
- Agent 回归测试需求:每次 AI Agent 的修改和发布上线,都需要对执行结果进行评估,相当于对 Agent 进行"回归测试",这需要大量可观测数据。
AI Agent 的复杂性、动态数据流的不确定性以及实时推理需求,使得传统监控手段难以满足。虽然 Agent 架构与传统微服务差异较大,但可观测思路一致——需要进行从端侧、到 AI Agent、到模型内部的端到端全链路可观测,实现交互过程全覆盖。




