Runbook 是 UModel 中供 Agent 程序化执行的结构化诊断协议,用于处理复杂的故障排查场景(如线索超过 5 个、涉及 3 个以上管理域)。它不是文档或 Wiki,包含三个层次:
- Observation(检查什么):定义每个检查项的具体步骤——查哪些实体、沿哪些关系遍历、比对什么字段。
- Conclusion(怎么判断):为每个观察定义匹配条件——满足什么条件得出什么结论、严重等级是什么。
- Knowledge(为什么是问题):提供故障模式的解释和计算公式,帮助 Agent 理解而不只是匹配。
与 RAG(让 Agent 检索文档后自行推理,容易遗漏、不可复现)不同,Runbook 保证两件事:完整性——不会漏掉关键检查项(如业务流量因子);确定性——同样的数据,不同时间、不同模型执行,结论一致。文章中 payment-gateway 过载案例就是靠 Runbook 系统化排查,避免被"最近有部署"的红鲱鱼误导。




