技术博客

超融合 Ceph 网络怎么设计?业务网、存储网和迁移网要不要分开

Ceph 网络设计会影响虚拟机 IO 延迟、恢复速度和故障隔离,超融合平台应避免所有流量混在一张网里。

Ceph网络设计超融合存储网络

超融合把计算和存储放在同一批节点上,网络设计就非常关键。虚拟机业务流量、Ceph 复制流量、恢复流量、管理流量、迁移流量如果全部混在一张网里,故障时很容易互相影响。

常见建议是至少区分管理网、业务网和存储网。规模较大时,还要单独考虑迁移网和备份网。

Ceph 对延迟和稳定性敏感。恢复或重平衡时,OSD 之间会产生大量流量。如果这些流量挤占虚拟机业务网,用户会直接感知到应用变慢。

设计要点:

常用排查:

ip -s link
ethtool -S eth0
ceph osd perf
ping -M do -s 8972 <peer>

网络问题最麻烦的地方是“看起来没断,但性能很差”。超融合平台上线前,必须做网络压测和故障演练,而不是只确认能 ping 通。

推荐网络分区

小型环境至少建议:

更稳的环境可以把迁移网、备份网单独拆出,避免备份窗口影响业务 IO。

MTU 检查

如果启用 jumbo frame,必须端到端一致。可以这样验证:

ping -M do -s 8972 <peer-ip>
ip link show

只在服务器上改 MTU,交换机没改,容易出现大包丢弃、小包正常的隐蔽问题。

故障演练

上线前建议模拟:

如果演练时业务延迟明显上升,就要重新评估网络带宽、恢复限速和故障域。