技术博客

Ceph OSD 容量水位怎么规划?超融合最怕磁盘快满

Ceph 是超融合常见存储底座,容量水位、故障域和恢复空间规划不当,会直接影响集群稳定性。

CephOSD容量规划超融合存储

超融合平台最容易被忽略的是存储容量水位。CPU 和内存不足通常还能扩容或迁移,Ceph 存储一旦接近满水位,恢复、重平衡和写入都会变得危险。

Ceph 不是把所有磁盘容量简单相加就能用。副本数、故障域、预留恢复空间、元数据、快照和未来增长都要计算。

例如三副本池,裸容量 300TB,理论可用约 100TB。但这 100TB 不能全部用满。节点故障后,集群需要空间恢复副本;扩容或重平衡也需要余量。

运维要关注几个指标:

ceph -s
ceph osd df
ceph df
ceph health detail

重点看 OSD 使用率是否不均衡、是否接近 nearfull/backfillfull/full 阈值、PG 是否长期 inactive 或 degraded。

容量规划建议:

Ceph 的稳定性很大程度取决于纪律。越是超融合环境,越要把容量水位当成生产红线。

容量计算示例

假设 6 个节点,每个节点 8 块 8TB 磁盘,裸容量约 384TB。如果使用三副本,理论可用约 128TB。但生产环境不建议把 128TB 全部用满。

如果按 70% 安全水位计算,建议业务可用容量控制在约 90TB 左右。剩余空间用于:

告警分级建议

运维动作

容量告警出现后,不要第一时间删除未知文件。先确认数据类型:虚拟机磁盘、快照、备份、对象数据还是临时文件。错误删除可能造成更大事故。

建议每周导出容量趋势,按月预测增长。超融合扩容通常涉及采购、上架、网络、平衡数据,不能等满了才开始。