Ceph OSD 容量水位怎么规划?超融合最怕磁盘快满
Ceph 是超融合常见存储底座,容量水位、故障域和恢复空间规划不当,会直接影响集群稳定性。
超融合平台最容易被忽略的是存储容量水位。CPU 和内存不足通常还能扩容或迁移,Ceph 存储一旦接近满水位,恢复、重平衡和写入都会变得危险。
Ceph 不是把所有磁盘容量简单相加就能用。副本数、故障域、预留恢复空间、元数据、快照和未来增长都要计算。
例如三副本池,裸容量 300TB,理论可用约 100TB。但这 100TB 不能全部用满。节点故障后,集群需要空间恢复副本;扩容或重平衡也需要余量。
运维要关注几个指标:
ceph -s
ceph osd df
ceph df
ceph health detail
重点看 OSD 使用率是否不均衡、是否接近 nearfull/backfillfull/full 阈值、PG 是否长期 inactive 或 degraded。
容量规划建议:
- 不要长期超过 70%-75% 使用率。
- 大容量盘恢复时间更长,要评估故障窗口。
- 同一故障域不要放太多副本风险。
- 快照和备份增长要单独估算。
- 扩容要提前做,不要等告警触发才买盘。
Ceph 的稳定性很大程度取决于纪律。越是超融合环境,越要把容量水位当成生产红线。
容量计算示例
假设 6 个节点,每个节点 8 块 8TB 磁盘,裸容量约 384TB。如果使用三副本,理论可用约 128TB。但生产环境不建议把 128TB 全部用满。
如果按 70% 安全水位计算,建议业务可用容量控制在约 90TB 左右。剩余空间用于:
- 节点或磁盘故障后的恢复。
- PG 重平衡。
- 快照增长。
- 临时迁移和备份。
- 未来短期增长。
告警分级建议
- 70%:容量评估,准备扩容计划。
- 75%:限制非必要大容量申请。
- 80%:进入风险状态,暂停大规模迁移和快照。
- 85%:紧急处理,优先扩容或迁移冷数据。
运维动作
容量告警出现后,不要第一时间删除未知文件。先确认数据类型:虚拟机磁盘、快照、备份、对象数据还是临时文件。错误删除可能造成更大事故。
