两者症状几乎一模一样:CPU 饱和、QPS 骤降,传播链都是 Redis 阻塞后下游业务服务超时、网关返回错误、入口接口变慢,底层机制也都是「慢命令独占单线程」。但成因不同,处置动作也就不同。第一种是业务常驻的 Lua 脚本自身存在重计算逻辑,特征是在告警时段内反复发作,修复方向是重构脚本,避免在脚本体中做重计算,必要时用 pipeline 拆批。第二种是异常来源发起的临时 EVAL 内联脚本(EVAL 正是 Redis 执行内联 Lua 脚本的命令),其中往往包含大规模循环,修复方向是先定位并阻断发起异常调用的客户端来源,再把计算逻辑移出 Redis。同症不同因,这正是把诊断精度做到命令级的价值。




