超融合容量规划:CPU、内存和存储为什么不能分开算
超融合节点同时承载计算和存储,容量规划要综合 CPU、内存、裸容量、副本、恢复空间和增长速度。
传统架构可以单独扩服务器或存储。超融合通常按节点扩容,计算和存储绑定在一起。因此容量规划不能只看某一个维度。
CPU 规划要考虑超分比。虚拟 CPU 可以超过物理核心数,但数据库、编译、AI 推理等负载不能过度超分。
内存通常比 CPU 更刚性。虚拟机分配出去的内存如果长期接近宿主机上限,会导致迁移困难和故障恢复困难。
存储要按副本或纠删码计算可用容量。还要预留恢复空间、快照、备份增长和临时迁移空间。
网络也不能忽略。节点越多,存储复制、恢复、迁移和备份流量越大。网络不足会让整个资源池变慢。
容量规划建议:
- 计算、内存、存储分别做水位线。
- 预留 N+1 故障资源。
- 定期预测 3-6 个月增长。
- 不要等超过 80% 才启动扩容。
- 扩容前评估机柜、电力、交换机端口和许可。
超融合的优势是扩展方便,但不是无限弹性。容量规划做不好,扩容窗口会变成救火现场。
N+1 资源预留怎么理解
N+1 表示任意一台节点故障后,剩余节点仍能承载关键业务。它不是一句口号,需要计算 CPU、内存、存储和网络。
例如 4 节点集群,如果平时整体资源已经使用 85%,任何一台节点故障后,剩余节点都很难稳定承载业务。即使 HA 能重启虚拟机,也可能因为资源不足导致性能雪崩。
月度容量报告建议
每月输出一次容量报告,至少包含:
- 总虚拟机数量。
- CPU 分配量与使用峰值。
- 内存分配量与使用峰值。
- 存储裸容量、可用容量、实际占用。
- 快照和备份增长。
- 预计还能支撑几个月增长。
