通过openclaw-cms-plugin的Trace功能可以精确定位Token消耗问题。每个LLM Span都带有完整的Token用量属性,包括input_tokens(输入Token数)、output_tokens(输出Token数)、cache_read.input_tokens(缓存命中Token数)、cache_creation.input_tokens(缓存写入Token数)和total_tokens(总Token数)。结合gen_ai.request.model和gen_ai.provider.name属性,可以精确知道哪个模型在哪一步消耗了多少Token。例如发现某次对话Trace中有5次LLM调用,其中一次input_tokens高达12000,点进去发现是工具返回了整页HTML被全部塞进上下文。diagnostics-otel则提供Token消耗速率和费用趋势的Metrics数据,支持按模型和时间维度拆分。配合CMS 2.0的告警功能,可以实现Token日消耗环比突增50%自动告警。




