凌晨 2:17,手机震动。PagerDuty 推送了一条 P1 告警:支付服务响应时间 P99 飙升至 12 秒,成功率跌至 83%。你打开电脑,盯着满屏的红色监控面板,脑子里只有一个问题:接下来做什么?
这就是 SRE 故障管理的核心挑战——不是缺少信息,而是缺少结构化的响应能力。本文从 On-Call 体系、故障生命周期、Runbook 设计到自动化实践,构建一套完整的故障响应框架,让你在面对生产事故时不再靠直觉,而是靠系统。
2026/6/13大约 31 分钟
凌晨 2:17,手机震动。PagerDuty 推送了一条 P1 告警:支付服务响应时间 P99 飙升至 12 秒,成功率跌至 83%。你打开电脑,盯着满屏的红色监控面板,脑子里只有一个问题:接下来做什么?
这就是 SRE 故障管理的核心挑战——不是缺少信息,而是缺少结构化的响应能力。本文从 On-Call 体系、故障生命周期、Runbook 设计到自动化实践,构建一套完整的故障响应框架,让你在面对生产事故时不再靠直觉,而是靠系统。
告警管理是 SRE 工作的核心能力之一。一个设计良好的告警体系能帮助团队在故障发生时快速定位问题,而设计糟糕的告警体系则会让 On-Call 工程师陷入"狼来了"的困境。
每一条告警都有明确的生命周期:
┌──────────┐ 条件满足 ┌──────────┐ 条件恢复 ┌───────────┐
│ Pending │──────────────>│ Firing │──────────────>│ Resolved │
│ (等待中) │ (等待for时长) │ (触发中) │ (指标恢复正常) │ (已恢复) │
└──────────┘ └──────────┘ └───────────┘