Skip to content

Latest commit

 

History

History
148 lines (104 loc) · 2.59 KB

File metadata and controls

148 lines (104 loc) · 2.59 KB

事故复盘报告

基本信息

字段 内容
事故标题
事故编号 INC-YYYY-MM-DD-XXX
严重等级 P0 / P1 / P2 / P3
发生时间
恢复时间
持续时长
影响范围 [多少用户/哪些功能]
复盘日期
参与人

1. 事故摘要

[用 2-3 句话概述:发生了什么、影响了什么、怎么解决的]


2. 时间线

时间 事件 操作人
HH:MM 事故发生(首次异常)
HH:MM 发现事故(告警/报告)
HH:MM 开始响应
HH:MM [关键操作 1]
HH:MM [关键操作 2]
HH:MM 服务恢复
HH:MM 确认完全恢复

关键时间节点

  • 发现时间(TTD):事故发生到被发现 = ___ 分钟
  • 响应时间(TTR):发现到开始处理 = ___ 分钟
  • 恢复时间(TTO):开始处理到恢复 = ___ 分钟

3. 影响评估

用户影响

  • 受影响用户数:
  • 影响的功能:
  • 用户体验描述:

业务影响

  • 数据损失:
  • 收入损失(如适用):
  • 声誉影响:

4. 根因分析

直接原因

[什么直接触发了事故?]

5 Whys 分析

Why 1: 为什么 [事故现象]?
→ 因为 [直接原因]

Why 2: 为什么 [直接原因]?
→ 因为 [更深层原因]

Why 3: 为什么 [更深层原因]?
→ 因为 [更深层原因]

Why 4: 为什么 [更深层原因]?
→ 因为 [更深层原因]

Why 5: 为什么 [更深层原因]?
→ 因为 [根本原因]

根本原因

[最终的根本原因是什么?]

贡献因素

  • [其他促成事故的因素]

5. 响应评估

做得好的

需要改进的

运气因素

  • [哪些地方是运气好才没更糟?]

6. 改进措施

# 改进项 类型 负责人 截止日期 状态
1 预防/检测/恢复/流程 待办
2 待办
3 待办

改进类型说明

  • 预防:防止同类事故再次发生
  • 检测:更早发现问题
  • 恢复:更快恢复服务
  • 流程:改进响应流程

7. 经验教训

技术层面

流程层面

监控/告警层面


8. 后续跟踪

  • 改进措施已纳入 backlog
  • 相关文档已更新
  • 必要时通知了受影响用户
  • 复盘报告已归档
  • 设置了改进措施完成提醒

附录

相关日志/截图

[链接或附件]

相关文档

  • [相关 ADR/设计文档]
  • [相关监控面板链接]