技术博客

GPU 节点可观测性 SLI/SLO:不要只盯利用率

GPU 利用率只是 AI 基础设施指标的一部分,生产环境还需要关注显存、温度、错误、排队、首 token 时间和任务成功率。

GPU监控SLISLO可观测性

很多团队刚开始做 GPU 监控时,只看一个指标:GPU 利用率。利用率低就认为资源浪费,利用率高就认为系统健康。这个判断很危险。

GPU 利用率只是瞬时计算忙碌程度。对于训练任务,还要看任务成功率、排队时间、显存峰值、数据加载瓶颈和节点稳定性。对于推理服务,还要看首 token 时间、每 token 延迟、错误率和吞吐。

GPU SLI 应该怎么设计

基础设施层可以关注:

平台层可以关注:

业务层可以关注:

SLO 不要定得太虚

“GPU 平台稳定”不是 SLO。更好的写法是:生产推理服务 99% 请求首 token 时间低于某个阈值;训练任务提交后 P95 等待时间低于某个阈值;GPU 节点每月因驱动异常导致的不可用时间低于某个阈值。

有了明确 SLO,运维团队才知道要优化监控、调度、容量还是故障恢复。

参考资料