阿里云 Hermes 可观测插件重点解决以下四类问题,它们的共同点是都不是结果而是过程:
- 第一类,过程不可见:很多系统接入大模型后,依然只能看到用户输入、最终输出和一条 usage 汇总。但 Hermes 一次响应背后可能有多轮推理、多次工具执行、上下文持续扩张以及新的推理循环。没有调用链时,中间过程基本就是空白,插件做的第一件事就是把这段空白补出来。
- 第二类,成本不可归因:Token 账单本身不是最难的,最难的是不知道钱花在哪里。一次运行之所以贵,可能是某一轮上下文突然膨胀、某个工具返回过大结果、最后一轮回答输出过长,或某类任务天然触发更多 step。看不到每一轮模型调用的 Token,成本分析就只能停留在猜测。
- 第三类,性能不可拆解:用户只会说它变慢了,但慢本身没有信息量。真正需要区分的是首 Token 慢还是整体生成慢、是工具执行慢还是多轮 ReAct 推理跑得太长。只有把阶段拆开,一次变慢才会变成可继续定位的问题。
- 第四类,结果不可复盘:最难处理的往往不是明确报错,而是看起来成功了但结果不对。Hermes 可能调用了错误的工具、工具返回不完整结果、基于局部信息继续推理,最后给出表面合理但路径已偏的答案。没有链路复盘几乎无从下手,有了链路问题才能从猜原因变成看路径。




