技术博客
聚合 Linux、Windows、Kubernetes、云原生、安全运维和自动化实践,沉淀可检索、可复用的技术文章。
Windows LAPS:2026 年还在共用本地管理员密码就该改了
Windows LAPS 已取代旧版 Microsoft LAPS,支持备份本地管理员密码到 AD 或 Microsoft Entra ID。本文讲解迁移、审计和运维检查。
Windows Server 2025 AD DS 升级:域控迁移前要知道的新变化
Windows Server 2025 带来 AD DS 数据库 32k page、LDAP 默认加密、TLS 1.3、Kerberos 配置变化等能力。本文整理域控升级前的检查重点。
Windows Server 2025 安全基线:新服务器上线前检查这 10 项
Windows Server 2025 带来 Credential Guard 默认启用、SMB 加固、Hotpatch preview 等安全能力。本文整理服务器上线前的运维检查清单。
Windows Server 2025 SMB 加固:签名、加密、NTLM 阻断和 QUIC 怎么理解
Windows Server 2025 与 Windows 11 24H2 强化了 SMB 安全默认值。本文解释 SMB signing、encryption、guest fallback、NTLM blocking、SMB over QUIC 和防火墙规则变化。
Ceph OSD 容量水位怎么规划?超融合最怕磁盘快满
Ceph 是超融合常见存储底座,容量水位、故障域和恢复空间规划不当,会直接影响集群稳定性。
Ceph PG Degraded 怎么排查?超融合存储故障处理思路
Ceph PG degraded 是超融合平台常见告警,排查时要结合 OSD、网络、磁盘、恢复队列和容量水位。
GPU 监控怎么做?DCGM Exporter、Prometheus 和 Grafana 运维入门
GPU 集群不能只靠 nvidia-smi 手工查看。本文解释 DCGM Exporter 如何暴露 GPU 指标,以及 Prometheus 告警和 Grafana 看板应该关注哪些数据。
GPU 驱动、CUDA 与容器运行时版本矩阵:为什么 AI 节点升级容易翻车?
GPU 节点升级不能只看一个软件版本,驱动、CUDA、容器镜像、NVIDIA Container Toolkit 和 Kubernetes 组件都需要形成版本矩阵。
Kueue 如何管理 AI 训练任务:队列、配额和 GPU 批处理运维
Kueue 是 Kubernetes 原生的作业排队和配额管理系统,适合 AI 训练、批处理和多租户 GPU 集群。本文解释 LocalQueue、ClusterQueue 和排障方法。
超融合 Ceph 网络怎么设计?业务网、存储网和迁移网要不要分开
Ceph 网络设计会影响虚拟机 IO 延迟、恢复速度和故障隔离,超融合平台应避免所有流量混在一张网里。
GPU 节点可观测性 SLI/SLO:不要只盯利用率
GPU 利用率只是 AI 基础设施指标的一部分,生产环境还需要关注显存、温度、错误、排队、首 token 时间和任务成功率。
GPU 服务器 Linux 运维上线前检查清单:驱动、CUDA、PCIe 和容器运行时
GPU 服务器上线前不能只看 nvidia-smi。本文整理 Linux 运维需要检查的硬件识别、驱动版本、CUDA、PCIe、NUMA、容器运行时和压力测试。
超融合存储:三副本和纠删码怎么选?
三副本和纠删码都能提供数据冗余,但在容量效率、写入性能、恢复复杂度和适用场景上差异很大。
Inference Gateway 是什么?Kubernetes 模型服务入口为什么需要新能力?
Kubernetes Gateway API Inference Extension 仍处于实验阶段,但它代表模型推理入口正在从普通 HTTP 路由走向推理感知路由。本文解释运维需要关注什么。
Ubuntu Server 启动慢怎么排查?systemd-analyze 实战思路
服务器重启后启动变慢,常见原因包括磁盘挂载、网络等待、服务依赖和 cloud-init,本文用 systemd-analyze 梳理排查路径。
