当前版本的 Hermes 可观测能力已经可以把一次真实的 agent 运行还原成 ReAct 结构化 Trace,核心链路形态为:invoke_agent Hermes 下挂 react step,每个 react step 包含 chat 和 execute_tool。如果一次任务包含多轮推理和多次工具调用,链路会自然展开。其意义不在于 span 变多,而在于 Hermes 的真实执行方式第一次变得可见——一次执行跑了几轮、哪一轮触发工具、工具又怎样影响后续推理,都能在同一条 Trace 中展开查看。具体记录的数据包括:
- 模型调用(chat span):记录 gen_ai.request.model、gen_ai.usage.input_tokens、gen_ai.usage.output_tokens、gen_ai.usage.total_tokens、gen_ai.response.time_to_first_token。这代表可以按每一次真实模型调用来看 Token 和时延,而不是只看一次会话的总账,streaming 场景下 TTFT 还能区分首字慢还是整体生成慢。
- 工具调用(execute_tool span):记录 gen_ai.tool.name、gen_ai.tool.call.arguments、gen_ai.tool.call.result。工具不再是过程中的空白节点,能看到 Hermes 在什么时候决定调用工具、调用了哪个、传了什么参数、返回了什么结果。
- Agent 级汇总(invoke_agent Hermes 根节点 span):记录整次运行的累计 Token、最终输出消息、总时耗信息,以及高危行为审计。




