GPU 节点可观测性 SLI/SLO:不要只盯利用率
GPU 利用率只是 AI 基础设施指标的一部分,生产环境还需要关注显存、温度、错误、排队、首 token 时间和任务成功率。
很多团队刚开始做 GPU 监控时,只看一个指标:GPU 利用率。利用率低就认为资源浪费,利用率高就认为系统健康。这个判断很危险。
GPU 利用率只是瞬时计算忙碌程度。对于训练任务,还要看任务成功率、排队时间、显存峰值、数据加载瓶颈和节点稳定性。对于推理服务,还要看首 token 时间、每 token 延迟、错误率和吞吐。
GPU SLI 应该怎么设计
基础设施层可以关注:
- GPU 利用率
- 显存使用率
- 温度和功耗
- ECC 错误
- XID 错误
- 节点 Ready 状态
- 设备插件健康状态
平台层可以关注:
- 任务等待时间
- 任务启动成功率
- GPU 分配失败次数
- 队列积压
- 资源碎片率
业务层可以关注:
- 推理请求成功率
- 首 token 时间
- 输出 token 速率
- 模型加载失败次数
- 用户可感知延迟
SLO 不要定得太虚
“GPU 平台稳定”不是 SLO。更好的写法是:生产推理服务 99% 请求首 token 时间低于某个阈值;训练任务提交后 P95 等待时间低于某个阈值;GPU 节点每月因驱动异常导致的不可用时间低于某个阈值。
有了明确 SLO,运维团队才知道要优化监控、调度、容量还是故障恢复。
