Ceph PG Degraded 怎么排查?超融合存储故障处理思路
Ceph PG degraded 是超融合平台常见告警,排查时要结合 OSD、网络、磁盘、恢复队列和容量水位。
Ceph 出现 PG degraded,说明部分数据副本处于降级状态。它不一定代表数据已经丢失,但表示冗余能力下降。超融合环境里,这类告警必须认真处理。
第一步看整体状态:
ceph -s
ceph health detail
确认 degraded PG 数量、影响对象数量、是否有 down OSD、是否正在 recovery/backfill。
第二步看 OSD:
ceph osd tree
ceph osd df
ceph osd perf
如果某个 OSD down,要判断是磁盘故障、进程异常、网络问题还是节点宕机。如果 OSD 还在但延迟很高,可能是磁盘性能或硬件问题。
第三步看容量。空间不足会阻碍恢复。某些 OSD 接近满水位时,即使故障已经恢复,PG 也可能长期不健康。
第四步看网络。Ceph 对集群网络很敏感,丢包、MTU 不一致、交换机错误、网卡驱动问题都可能导致 OSD 抖动。
处理时不要急着反复重启服务。先保留状态,确认故障范围,再决定是标记 out、更换磁盘、恢复网络,还是等待 backfill 完成。
PG degraded 排查的核心是判断:集群是在正常恢复,还是恢复被某个瓶颈卡住。
处理时的禁止动作
PG degraded 时最怕误操作。以下动作要谨慎:
- 不明原因时同时重启多个 OSD。
- 在容量紧张时强制大量 backfill。
- 没确认副本状态就删除 OSD 数据目录。
- 未备份配置就修改 CRUSH rule。
- 在恢复过程中叠加大规模虚拟机迁移。
判断恢复是否正常
观察几轮 ceph -s,如果 degraded 对象数量持续下降,recovery/backfill 有进展,说明集群可能正在正常恢复。
如果长时间不变,要继续看:
ceph health detail
ceph pg dump_stuck
ceph osd perf
ceph osd df
如果某些 OSD 延迟明显高,可能是坏盘、固件、控制器或网络问题。不要只看 OSD up/down,慢盘同样会拖垮恢复。
恢复后验证
恢复完成后要确认:
ceph -s无 degraded。- OSD 使用率没有明显倾斜。
- 虚拟机 IO 延迟恢复正常。
- 备份任务恢复正常。
- 相关告警关闭。
