技术博客

Ceph PG Degraded 怎么排查?超融合存储故障处理思路

Ceph PG degraded 是超融合平台常见告警,排查时要结合 OSD、网络、磁盘、恢复队列和容量水位。

CephPG故障排查超融合

Ceph 出现 PG degraded,说明部分数据副本处于降级状态。它不一定代表数据已经丢失,但表示冗余能力下降。超融合环境里,这类告警必须认真处理。

第一步看整体状态:

ceph -s
ceph health detail

确认 degraded PG 数量、影响对象数量、是否有 down OSD、是否正在 recovery/backfill。

第二步看 OSD:

ceph osd tree
ceph osd df
ceph osd perf

如果某个 OSD down,要判断是磁盘故障、进程异常、网络问题还是节点宕机。如果 OSD 还在但延迟很高,可能是磁盘性能或硬件问题。

第三步看容量。空间不足会阻碍恢复。某些 OSD 接近满水位时,即使故障已经恢复,PG 也可能长期不健康。

第四步看网络。Ceph 对集群网络很敏感,丢包、MTU 不一致、交换机错误、网卡驱动问题都可能导致 OSD 抖动。

处理时不要急着反复重启服务。先保留状态,确认故障范围,再决定是标记 out、更换磁盘、恢复网络,还是等待 backfill 完成。

PG degraded 排查的核心是判断:集群是在正常恢复,还是恢复被某个瓶颈卡住。

处理时的禁止动作

PG degraded 时最怕误操作。以下动作要谨慎:

判断恢复是否正常

观察几轮 ceph -s,如果 degraded 对象数量持续下降,recovery/backfill 有进展,说明集群可能正在正常恢复。

如果长时间不变,要继续看:

ceph health detail
ceph pg dump_stuck
ceph osd perf
ceph osd df

如果某些 OSD 延迟明显高,可能是坏盘、固件、控制器或网络问题。不要只看 OSD up/down,慢盘同样会拖垮恢复。

恢复后验证

恢复完成后要确认:

故障结束后要记录根因和处理时间,更新 Runbook。