TTFT 是 Time To First Token(首字延迟)的缩写,指从发起请求到返回第一个 Token 所经历的时间。在 Hermes 可观测方案中,对 streaming 场景单独记录了 TTFT,这对性能定位非常关键。
原因在于:用户只会告诉你它变慢了,但慢本身其实没有信息量。很多时候用户感知到的慢,并不一定是整段生成都慢,而是第一个字迟迟没有返回。如果没有 TTFT 这个指标,开发者只能笼统地知道响应慢,却无法判断瓶颈在哪。
有了 TTFT,性能问题才能从感觉慢进一步拆成两种不同的情况:
- 首字慢:第一个 Token 返回就很慢,通常意味着模型排队、上下文过长导致首次推理耗时高,或上游链路存在延迟。
- 整体生成慢:首字返回正常,但后续 Token 持续生成的整体过程慢,通常意味着生成内容过长或生成速率受限。
TTFT 是在 chat span 中通过 gen_ai.response.time_to_first_token 字段记录的,结合每一次真实模型调用的 input_tokens、output_tokens、total_tokens 等数据,可以按调用粒度精确分析时延,而不是只看一次会话的总账。这样一次抽象的变慢就被拆解成了可以继续定位的具体问题。




