技术博客

聚合 Linux、Windows、Kubernetes、云原生、安全运维和自动化实践,沉淀可检索、可复用的技术文章。

全部文章

共 241 篇文章,当前第 9 / 17 页

2026/7/21 · 安全运维 · 8分钟阅读

Windows LAPS:2026 年还在共用本地管理员密码就该改了

Windows LAPS 已取代旧版 Microsoft LAPS,支持备份本地管理员密码到 AD 或 Microsoft Entra ID。本文讲解迁移、审计和运维检查。

Windows LAPS本地管理员Active DirectoryEntra ID
2026/7/21 · Windows 运维 · 9分钟阅读

Windows Server 2025 AD DS 升级:域控迁移前要知道的新变化

Windows Server 2025 带来 AD DS 数据库 32k page、LDAP 默认加密、TLS 1.3、Kerberos 配置变化等能力。本文整理域控升级前的检查重点。

Active DirectoryWindows Server 2025域控LDAP
2026/7/21 · Windows 运维 · 8分钟阅读

Windows Server 2025 安全基线:新服务器上线前检查这 10 项

Windows Server 2025 带来 Credential Guard 默认启用、SMB 加固、Hotpatch preview 等安全能力。本文整理服务器上线前的运维检查清单。

Windows Server 2025安全基线服务器加固Credential Guard
2026/7/21 · 安全运维 · 9分钟阅读

Windows Server 2025 SMB 加固:签名、加密、NTLM 阻断和 QUIC 怎么理解

Windows Server 2025 与 Windows 11 24H2 强化了 SMB 安全默认值。本文解释 SMB signing、encryption、guest fallback、NTLM blocking、SMB over QUIC 和防火墙规则变化。

SMBWindows Server 2025文件共享NTLM
2026/7/20 · 超融合 · 7分钟阅读

Ceph OSD 容量水位怎么规划?超融合最怕磁盘快满

Ceph 是超融合常见存储底座,容量水位、故障域和恢复空间规划不当,会直接影响集群稳定性。

CephOSD容量规划超融合存储
2026/7/20 · 超融合 · 7分钟阅读

Ceph PG Degraded 怎么排查?超融合存储故障处理思路

Ceph PG degraded 是超融合平台常见告警,排查时要结合 OSD、网络、磁盘、恢复队列和容量水位。

CephPG故障排查超融合
2026/7/20 · 监控告警 · 8分钟阅读

GPU 监控怎么做?DCGM Exporter、Prometheus 和 Grafana 运维入门

GPU 集群不能只靠 nvidia-smi 手工查看。本文解释 DCGM Exporter 如何暴露 GPU 指标,以及 Prometheus 告警和 Grafana 看板应该关注哪些数据。

DCGM ExporterGPU监控PrometheusGrafana
2026/7/20 · AI基础设施 · 8分钟阅读

GPU 驱动、CUDA 与容器运行时版本矩阵:为什么 AI 节点升级容易翻车?

GPU 节点升级不能只看一个软件版本,驱动、CUDA、容器镜像、NVIDIA Container Toolkit 和 Kubernetes 组件都需要形成版本矩阵。

GPU运维CUDA容器运行时版本管理
2026/7/20 · Kubernetes · 9分钟阅读

Kueue 如何管理 AI 训练任务:队列、配额和 GPU 批处理运维

Kueue 是 Kubernetes 原生的作业排队和配额管理系统,适合 AI 训练、批处理和多租户 GPU 集群。本文解释 LocalQueue、ClusterQueue 和排障方法。

KueueGPU配额批处理AI训练
2026/7/19 · 超融合 · 7分钟阅读

超融合 Ceph 网络怎么设计?业务网、存储网和迁移网要不要分开

Ceph 网络设计会影响虚拟机 IO 延迟、恢复速度和故障隔离,超融合平台应避免所有流量混在一张网里。

Ceph网络设计超融合存储网络
2026/7/19 · AI基础设施 · 7分钟阅读

GPU 节点可观测性 SLI/SLO:不要只盯利用率

GPU 利用率只是 AI 基础设施指标的一部分,生产环境还需要关注显存、温度、错误、排队、首 token 时间和任务成功率。

GPU监控SLISLO可观测性
2026/7/19 · Linux · 9分钟阅读

GPU 服务器 Linux 运维上线前检查清单:驱动、CUDA、PCIe 和容器运行时

GPU 服务器上线前不能只看 nvidia-smi。本文整理 Linux 运维需要检查的硬件识别、驱动版本、CUDA、PCIe、NUMA、容器运行时和压力测试。

GPU服务器Linux运维NVIDIA驱动CUDA
2026/7/19 · 超融合 · 7分钟阅读

超融合存储:三副本和纠删码怎么选?

三副本和纠删码都能提供数据冗余,但在容量效率、写入性能、恢复复杂度和适用场景上差异很大。

超融合存储三副本纠删码Ceph
2026/7/19 · 云原生 · 8分钟阅读

Inference Gateway 是什么?Kubernetes 模型服务入口为什么需要新能力?

Kubernetes Gateway API Inference Extension 仍处于实验阶段,但它代表模型推理入口正在从普通 HTTP 路由走向推理感知路由。本文解释运维需要关注什么。

Inference GatewayGateway API模型服务Kubernetes
2026/7/19 · Linux · 7分钟阅读

Ubuntu Server 启动慢怎么排查?systemd-analyze 实战思路

服务器重启后启动变慢,常见原因包括磁盘挂载、网络等待、服务依赖和 cloud-init,本文用 systemd-analyze 梳理排查路径。

Ubuntusystemd启动优化故障排查