超融合平台监控指标:别只看虚拟机 CPU 和内存
超融合监控要覆盖计算、存储、网络、虚拟机、备份和集群健康,单看 VM 指标远远不够。
很多团队搭好虚拟化平台后,只监控虚拟机 CPU、内存和磁盘使用率。这对超融合平台远远不够。
超融合平台的故障往往来自底层资源:存储延迟、OSD 异常、网络丢包、节点负载不均、备份失败、容量水位过高。
建议监控分层:
计算层:
- 宿主机 CPU、内存、负载。
- 虚拟机运行状态。
- 虚拟机迁移失败次数。
存储层:
- 集群健康状态。
- 容量水位。
- OSD/磁盘状态。
- 存储延迟和恢复状态。
网络层:
- 网卡错误包、丢包。
- 存储网络延迟。
- 迁移网络带宽。
运维层:
- 备份成功率。
- 快照数量。
- 任务队列。
- 节点维护状态。
告警要可行动。比如“存储延迟升高”应该告诉值班人员先看哪些 OSD、哪些节点、是否有恢复任务,而不是只发一个红色提示。
超融合监控的目标是提前发现风险,不是等虚拟机已经卡死才报警。
建议告警规则
容量类:
- 存储使用率超过 75% 预警。
- 存储使用率超过 85% 严重告警。
- 单个 OSD 使用率明显高于平均值。
性能类:
- 存储 P95/P99 延迟超过基线。
- 网卡错误包持续增长。
- 迁移任务失败率升高。
可用性类:
- 节点离线。
- OSD down。
- PG degraded。
- 备份连续失败。
仪表盘建议
一个好用的 HCI Dashboard 应该同时展示:
- 集群健康总览。
- 节点资源水位。
- 存储容量趋势。
- 存储延迟趋势。
- Top 虚拟机 IO。
- 备份成功率。
- 当前告警和变更窗口。
