故障排查
顶有教育科技故障排查分类文章,覆盖 Linux、Windows、Kubernetes、云原生、安全运维和自动化实践。当前分类共 6 篇文章,按发布时间从新到旧排列。
GPU 节点故障自愈:Node Problem Detector 与自动隔离实战
详解如何在 Kubernetes GPU 集群中通过 Node Problem Detector(NPD)检测 GPU 故障、上报 NodeCondition、结合 Node Auto Remediation 实现节点自动隔离与修复,涵盖 NVIDIA XID 错误、ECC 故障、驱动崩溃等常见场景。
网络故障排查:mtr、tcpdump 和 ss 应该怎么组合使用?
网络问题不能只 ping,一线运维需要把路径质量、端口状态、连接队列和抓包证据结合起来判断。
DNS 故障排查:dig、resolvectl 和 systemd-resolved 怎么看?
DNS 问题会表现为应用超时、访问慢和证书异常,本文梳理 Linux 服务器上 DNS 排查的常用命令和思路。
Linux Load 很高但 CPU 不高,问题可能在哪里?
Load Average 不等于 CPU 使用率。磁盘 IO、不可中断睡眠、进程排队和系统调用阻塞都可能导致 Load 升高。
证书过期故障怎么排查?TLS 到期前应该监控什么
TLS 证书过期会造成网站、API、内部服务和对象存储访问失败,本文总结证书检查、监控和续期流程。
Linux服务器排障常用命令:从CPU、内存、磁盘到端口和日志
整理 Linux 运维排障中最常用的命令,覆盖 CPU、内存、磁盘、网络端口、服务状态和日志定位。
