超融合故障 Runbook 怎么写?从节点宕机到存储降级
超融合故障处理需要标准 Runbook,把节点、存储、网络、虚拟机和备份检查步骤固化下来。
超融合平台故障时,值班人员最怕不知道先看什么。节点、存储、网络、虚拟机、备份都可能相关。如果没有 Runbook,很容易靠经验救火。
一个基础 Runbook 应该覆盖几类场景:
- 节点宕机。
- 磁盘或 OSD 故障。
- PG degraded。
- 存储延迟升高。
- 虚拟机无法启动。
- 热迁移失败。
- 备份失败。
- 管理平台不可访问。
每个场景都要写清楚:
- 告警含义。
- 影响范围。
- 第一批检查命令。
- 禁止操作。
- 可执行恢复步骤。
- 升级联系人。
- 恢复后验证。
例如 Ceph degraded 场景,要先看 ceph -s 和 ceph health detail,确认是否正在恢复;禁止在原因不明时反复重启多个 OSD。
Runbook 不需要写成长篇论文,但必须能让新人按步骤收集信息、避免扩大故障。
好的运维体系,不是依赖某个高手,而是让团队在压力下仍能按流程行动。
节点宕机 Runbook 示例
第一步确认影响:
pvecm status
ceph -s
qm list
第二步确认虚拟机是否被 HA 拉起。没有自动恢复的虚拟机要记录名称、业务负责人和恢复动作。
第三步确认存储是否 degraded。如果 Ceph 正在恢复,不要叠加大规模迁移。
第四步判断节点故障原因:电源、网络、硬件、系统崩溃还是人为重启。
第五步节点恢复后,不要马上关闭事件。要观察存储恢复完成、业务验证通过、备份任务恢复。
Runbook 维护
每次故障后都要更新 Runbook。比如这次发现某个命令不好用、某个联系人变更、某个告警误报,都要记录。
