你永远修不完所有 bug,人生也是
凌晨三点的告警把我叫醒。
Prometheus 大盘一片红,核心服务 5xx 飙到 30%,Slack 里已经炸了。我一边 ssh 上跳板机,一边在脑子里过可能的原因:配置变更?流量突增?依赖服务挂了?
排查 40 分钟,发现上游服务连接池耗尽,级联超时。根因是两周前一次"无害"的参数调整——连接超时从 3 秒改成 10 秒,觉得"宽裕点总没错"。没人 review,因为改动太小了。
修完写完复盘,凌晨五点。躺回床上睡不着,脑子里冒出一个念头:这种事永远不会结束。
不是这个 bug,就是下一个。系统足够复杂之后,故障不是意外,而是常态。
做运维这些年...