技术博客

聚合 Linux、Windows、Kubernetes、云原生、安全运维和自动化实践,沉淀可检索、可复用的技术文章。

全部文章

共 204 篇文章,当前第 8 / 14 页

2026/7/21 · Linux · 9分钟阅读

Ubuntu 26.04 LTS 服务器升级前要检查什么

Ubuntu 26.04 LTS 已发布,本文面向 Linux 运维整理从 24.04 LTS 升级到 26.04 LTS 前需要关注的安全、内核、sudo-rs、rust-coreutils 和回滚准备。

Ubuntu 26.04Linux升级服务器运维LTS
2026/7/21 · Windows 运维 · 8分钟阅读

Windows 11 25H2 与 26H1:企业终端升级路线怎么规划

截至 2026 年 7 月,Windows 11 25H2 是面向现有设备的主要版本,26H1 主要面向 2026 年初上市的新设备。本文梳理企业终端升级和支持周期规划。

Windows 1125H226H1终端运维
2026/7/21 · Windows 运维 · 7分钟阅读

Windows 11 Hotpatch:企业终端少重启补丁怎么落地

Windows 11 Enterprise 24H2/25H2 支持 Hotpatch 日历。本文解释 baseline、hotpatch、适用范围和企业落地检查。

Windows HotpatchWindows 11 EnterpriseAutopatch补丁管理
2026/7/21 · Windows 运维 · 8分钟阅读

2026 年 7 月 Windows Patch Tuesday:终端补丁管理要看什么

2026 年 7 月 Windows 累积更新覆盖 Windows 11 25H2、24H2 等版本。本文从企业运维角度整理补丁测试、暂停、加急和回滚检查。

Patch TuesdayWindows Update补丁管理终端安全
2026/7/21 · 安全运维 · 8分钟阅读

Windows LAPS:2026 年还在共用本地管理员密码就该改了

Windows LAPS 已取代旧版 Microsoft LAPS,支持备份本地管理员密码到 AD 或 Microsoft Entra ID。本文讲解迁移、审计和运维检查。

Windows LAPS本地管理员Active DirectoryEntra ID
2026/7/21 · Windows 运维 · 9分钟阅读

Windows Server 2025 AD DS 升级:域控迁移前要知道的新变化

Windows Server 2025 带来 AD DS 数据库 32k page、LDAP 默认加密、TLS 1.3、Kerberos 配置变化等能力。本文整理域控升级前的检查重点。

Active DirectoryWindows Server 2025域控LDAP
2026/7/21 · Windows 运维 · 8分钟阅读

Windows Server 2025 安全基线:新服务器上线前检查这 10 项

Windows Server 2025 带来 Credential Guard 默认启用、SMB 加固、Hotpatch preview 等安全能力。本文整理服务器上线前的运维检查清单。

Windows Server 2025安全基线服务器加固Credential Guard
2026/7/21 · 安全运维 · 9分钟阅读

Windows Server 2025 SMB 加固:签名、加密、NTLM 阻断和 QUIC 怎么理解

Windows Server 2025 与 Windows 11 24H2 强化了 SMB 安全默认值。本文解释 SMB signing、encryption、guest fallback、NTLM blocking、SMB over QUIC 和防火墙规则变化。

SMBWindows Server 2025文件共享NTLM
2026/7/20 · 超融合 · 7分钟阅读

Ceph OSD 容量水位怎么规划?超融合最怕磁盘快满

Ceph 是超融合常见存储底座,容量水位、故障域和恢复空间规划不当,会直接影响集群稳定性。

CephOSD容量规划超融合存储
2026/7/20 · 超融合 · 7分钟阅读

Ceph PG Degraded 怎么排查?超融合存储故障处理思路

Ceph PG degraded 是超融合平台常见告警,排查时要结合 OSD、网络、磁盘、恢复队列和容量水位。

CephPG故障排查超融合
2026/7/20 · 监控告警 · 8分钟阅读

GPU 监控怎么做?DCGM Exporter、Prometheus 和 Grafana 运维入门

GPU 集群不能只靠 nvidia-smi 手工查看。本文解释 DCGM Exporter 如何暴露 GPU 指标,以及 Prometheus 告警和 Grafana 看板应该关注哪些数据。

DCGM ExporterGPU监控PrometheusGrafana
2026/7/20 · AI基础设施 · 8分钟阅读

GPU 驱动、CUDA 与容器运行时版本矩阵:为什么 AI 节点升级容易翻车?

GPU 节点升级不能只看一个软件版本,驱动、CUDA、容器镜像、NVIDIA Container Toolkit 和 Kubernetes 组件都需要形成版本矩阵。

GPU运维CUDA容器运行时版本管理
2026/7/20 · Kubernetes · 9分钟阅读

Kueue 如何管理 AI 训练任务:队列、配额和 GPU 批处理运维

Kueue 是 Kubernetes 原生的作业排队和配额管理系统,适合 AI 训练、批处理和多租户 GPU 集群。本文解释 LocalQueue、ClusterQueue 和排障方法。

KueueGPU配额批处理AI训练
2026/7/19 · 超融合 · 7分钟阅读

超融合 Ceph 网络怎么设计?业务网、存储网和迁移网要不要分开

Ceph 网络设计会影响虚拟机 IO 延迟、恢复速度和故障隔离,超融合平台应避免所有流量混在一张网里。

Ceph网络设计超融合存储网络
2026/7/19 · AI基础设施 · 7分钟阅读

GPU 节点可观测性 SLI/SLO:不要只盯利用率

GPU 利用率只是 AI 基础设施指标的一部分,生产环境还需要关注显存、温度、错误、排队、首 token 时间和任务成功率。

GPU监控SLISLO可观测性