技术博客

超融合故障 Runbook 怎么写?从节点宕机到存储降级

超融合故障处理需要标准 Runbook,把节点、存储、网络、虚拟机和备份检查步骤固化下来。

Runbook超融合故障应急响应运维流程

超融合平台故障时,值班人员最怕不知道先看什么。节点、存储、网络、虚拟机、备份都可能相关。如果没有 Runbook,很容易靠经验救火。

一个基础 Runbook 应该覆盖几类场景:

每个场景都要写清楚:

  1. 告警含义。
  2. 影响范围。
  3. 第一批检查命令。
  4. 禁止操作。
  5. 可执行恢复步骤。
  6. 升级联系人。
  7. 恢复后验证。

例如 Ceph degraded 场景,要先看 ceph -sceph health detail,确认是否正在恢复;禁止在原因不明时反复重启多个 OSD。

Runbook 不需要写成长篇论文,但必须能让新人按步骤收集信息、避免扩大故障。

好的运维体系,不是依赖某个高手,而是让团队在压力下仍能按流程行动。

节点宕机 Runbook 示例

第一步确认影响:

pvecm status
ceph -s
qm list

第二步确认虚拟机是否被 HA 拉起。没有自动恢复的虚拟机要记录名称、业务负责人和恢复动作。

第三步确认存储是否 degraded。如果 Ceph 正在恢复,不要叠加大规模迁移。

第四步判断节点故障原因:电源、网络、硬件、系统崩溃还是人为重启。

第五步节点恢复后,不要马上关闭事件。要观察存储恢复完成、业务验证通过、备份任务恢复。

Runbook 维护

每次故障后都要更新 Runbook。比如这次发现某个命令不好用、某个联系人变更、某个告警误报,都要记录。

Runbook 是活文档,不是写完放着看的文档。