<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0">
  <channel>
    <title>顶有教育科技技术博客</title>
    <link>https://www.zdyedu.cn/blog/</link>
    <description>Linux、Windows、Kubernetes、云原生、安全运维和自动化实践文章。</description>
    <language>zh-CN</language>
    <lastBuildDate>Wed, 22 Jul 2026 14:05:21 GMT</lastBuildDate>
    
      <item>
        <title>AI 编程工具运维实战：Cursor、Claude Code 等工具的真实使用场景</title>
        <link>https://www.zdyedu.cn/blog/ai-coding-tools-devops-ops-guide/</link>
        <guid>https://www.zdyedu.cn/blog/ai-coding-tools-devops-ops-guide/</guid>
        <description>从运维工程师视角评测 Cursor、Claude Code、GitHub Copilot 等 AI 编程工具在运维场景中的实际效果，包括 Shell 脚本生成、Dockerfile 优化、Kubernetes YAML 生成、日志分析自动化等典型场景的使用技巧和效率对比。</description>
        <category>自动化运维</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>AI 工具生成 Kubernetes YAML 实战：从 Prompt 到生产可用配置</title>
        <link>https://www.zdyedu.cn/blog/ai-tools-kubernetes-yaml-generation-guide/</link>
        <guid>https://www.zdyedu.cn/blog/ai-tools-kubernetes-yaml-generation-guide/</guid>
        <description>系统讲解如何用 AI 工具（Cursor、ChatGPT、Claude）高效生成生产级 Kubernetes YAML，包括 Prompt 工程技巧、常见资源类型的最佳实践模板、AI 生成内容的验证检查清单，以及 K8s GPT、kubectl-ai 等专业 K8s AI 工具的使用方法。</description>
        <category>Kubernetes</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>AMD GPU Operator + ROCm 7 Kubernetes 部署运维实践</title>
        <link>https://www.zdyedu.cn/blog/amd-gpu-operator-rocm7-kubernetes-ops/</link>
        <guid>https://www.zdyedu.cn/blog/amd-gpu-operator-rocm7-kubernetes-ops/</guid>
        <description>完整介绍 AMD GPU Operator 1.5 在 Kubernetes 上的安装配置、ROCm 7 驱动管理、DRA 动态资源分配、自动节点修复（ANR）与监控指标接入，覆盖 MI300X 和 RDNA 4 工作站 GPU。</description>
        <category>AI基础设施</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>ArgoCD App of Apps 模式：多集群 GitOps 统一管理实战</title>
        <link>https://www.zdyedu.cn/blog/argocd-app-of-apps-multi-cluster-ops/</link>
        <guid>https://www.zdyedu.cn/blog/argocd-app-of-apps-multi-cluster-ops/</guid>
        <description>详解 ArgoCD App of Apps 设计模式的原理和落地方案，包括如何用一个根 Application 管理所有子 Application、多集群注册与部署、ApplicationSet 大规模集群扩展、以及 ArgoCD Projects 的 RBAC 权限隔离。</description>
        <category>自动化运维</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>ArgoCD 多环境部署实战：Helm + Kustomize 管理 Dev/Staging/Prod 差异</title>
        <link>https://www.zdyedu.cn/blog/argocd-helm-kustomize-multi-env-deployment/</link>
        <guid>https://www.zdyedu.cn/blog/argocd-helm-kustomize-multi-env-deployment/</guid>
        <description>详解如何用 ArgoCD 配合 Helm values 文件或 Kustomize overlays 管理 dev/staging/production 三套环境的配置差异，包括镜像标签策略、环境变量注入、资源配额差异、ApplicationSet 批量管理，避免重复 YAML。</description>
        <category>自动化运维</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>昇腾 NPU 接入 Kubernetes 运维全流程</title>
        <link>https://www.zdyedu.cn/blog/ascend-npu-kubernetes-ops-guide/</link>
        <guid>https://www.zdyedu.cn/blog/ascend-npu-kubernetes-ops-guide/</guid>
        <description>从 ascend-device-plugin 安装、CANN 软件栈配置、NPU 健康检查到集群故障隔离，完整覆盖华为昇腾 910B/950 系列 NPU 在 Kubernetes 生产集群中的运维实践。</description>
        <category>AI基础设施</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Cilium 替换 Calico/Flannel 实战：基于 eBPF 的高性能 K8s 网络</title>
        <link>https://www.zdyedu.cn/blog/cilium-kubernetes-cni-replace-calico-guide/</link>
        <guid>https://www.zdyedu.cn/blog/cilium-kubernetes-cni-replace-calico-guide/</guid>
        <description>完整讲解如何在 Kubernetes 集群中用 Cilium 替换 Calico 或 Flannel，包括 Helm 安装、kube-proxy 替换、Hubble 可观测性开启、以及与旧 CNI 迁移过程中的常见问题处理。</description>
        <category>Kubernetes</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Cilium 零信任网络策略实战：L3/L4/L7 全栈访问控制</title>
        <link>https://www.zdyedu.cn/blog/cilium-zero-trust-network-policy-l3-l7/</link>
        <guid>https://www.zdyedu.cn/blog/cilium-zero-trust-network-policy-l3-l7/</guid>
        <description>通过实际案例讲解如何用 CiliumNetworkPolicy 实现 Kubernetes 零信任网络，包括默认拒绝策略、基于标签的 L3/L4 控制、HTTP/gRPC 级别 L7 策略、DNS 策略和出口流量控制，覆盖微服务安全架构的核心场景。</description>
        <category>安全运维</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Claude Code 运维自动化实战：让 AI 直接操作你的 Linux 服务器</title>
        <link>https://www.zdyedu.cn/blog/claude-code-linux-ops-automation/</link>
        <guid>https://www.zdyedu.cn/blog/claude-code-linux-ops-automation/</guid>
        <description>实战讲解如何用 Claude Code（Anthropic 出品的终端 AI 代理）完成复杂运维任务：自动分析日志、批量修改配置、生成并执行监控脚本、自动化故障排查，以及在保证安全的前提下最大化 AI 的运维效率。</description>
        <category>自动化运维</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>eBPF 是什么：从零理解 Linux 内核可编程化</title>
        <link>https://www.zdyedu.cn/blog/ebpf-beginner-guide-linux-kernel-networking/</link>
        <guid>https://www.zdyedu.cn/blog/ebpf-beginner-guide-linux-kernel-networking/</guid>
        <description>通俗讲解 eBPF 的核心原理、与传统内核模块的区别、安全验证机制，以及 eBPF 在网络观测、安全策略、性能追踪三大场景的实际应用，帮助运维工程师建立正确的 eBPF 认知框架。</description>
        <category>云原生</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>FP8/FP4 量化生产推理实战：TensorRT ModelOpt 完全指南</title>
        <link>https://www.zdyedu.cn/blog/fp8-fp4-quantization-tensorrt-modelopt-guide/</link>
        <guid>https://www.zdyedu.cn/blog/fp8-fp4-quantization-tensorrt-modelopt-guide/</guid>
        <description>深入讲解 NVIDIA TensorRT ModelOpt 的 FP8 与 FP4 量化原理、校准数据准备、生产导出流程，以及在 H100/H200/B200 上的性能提升数据，覆盖 Qwen3、Llama4 等主流模型的量化实践。</description>
        <category>AI基础设施</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>GitOps 是什么：从概念到 ArgoCD 快速入门</title>
        <link>https://www.zdyedu.cn/blog/gitops-argocd-beginner-guide/</link>
        <guid>https://www.zdyedu.cn/blog/gitops-argocd-beginner-guide/</guid>
        <description>通俗讲解 GitOps 的核心理念、与传统 CI/CD 的区别，以及如何用 ArgoCD 在 Kubernetes 上实现声明式持续交付——从安装到第一个 Application 上线，含完整命令和配置示例。</description>
        <category>自动化运维</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>GPU 节点故障自愈：Node Problem Detector 与自动隔离实战</title>
        <link>https://www.zdyedu.cn/blog/gpu-node-auto-remediation-npd-isolation/</link>
        <guid>https://www.zdyedu.cn/blog/gpu-node-auto-remediation-npd-isolation/</guid>
        <description>详解如何在 Kubernetes GPU 集群中通过 Node Problem Detector（NPD）检测 GPU 故障、上报 NodeCondition、结合 Node Auto Remediation 实现节点自动隔离与修复，涵盖 NVIDIA XID 错误、ECC 故障、驱动崩溃等常见场景。</description>
        <category>故障排查</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>GPUStack 异构 GPU 集群管理实战：统一调度 NVIDIA/AMD/昇腾</title>
        <link>https://www.zdyedu.cn/blog/gpustack-heterogeneous-gpu-cluster-management/</link>
        <guid>https://www.zdyedu.cn/blog/gpustack-heterogeneous-gpu-cluster-management/</guid>
        <description>介绍开源 GPU 集群管理器 GPUStack 的架构与核心功能，详解在混合 NVIDIA、AMD ROCm、华为昇腾 GPU 环境下统一部署 LLM 推理服务，以及显存感知调度、多节点推理与 OpenAI 兼容 API 实践。</description>
        <category>AI基础设施</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Grafana Dashboard 设计最佳实践：变量、告警、Dashboard as Code</title>
        <link>https://www.zdyedu.cn/blog/grafana-dashboard-design-best-practices/</link>
        <guid>https://www.zdyedu.cn/blog/grafana-dashboard-design-best-practices/</guid>
        <description>系统讲解 Grafana Dashboard 的专业设计方法：模板变量（Template Variables）实现动态下钻、Panel 类型选择与 PromQL 实战（时序图/Stat/Gauge/Heatmap）、Dashboard 告警配置、使用 Grafonnet 和 Terraform 实现 Dashboard as Code、Grafana 数据源代理与权限管理的生产配置。</description>
        <category>监控告警</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>HAMi 是什么？Kubernetes GPU 共享运维要关注哪些问题？</title>
        <link>https://www.zdyedu.cn/blog/hami-kubernetes-gpu-sharing-ops-guide/</link>
        <guid>https://www.zdyedu.cn/blog/hami-kubernetes-gpu-sharing-ops-guide/</guid>
        <description>HAMi 已成为 CNCF Incubating 项目，面向 Kubernetes 提供 GPU 和异构加速器虚拟化能力。本文解释它解决的问题、核心组件和运维检查点。</description>
        <category>AI基础设施</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>ACL 访问控制实验：为什么匹配顺序比规则本身更重要？</title>
        <link>https://www.zdyedu.cn/blog/hcia-datacom-acl-traffic-control/</link>
        <guid>https://www.zdyedu.cn/blog/hcia-datacom-acl-traffic-control/</guid>
        <description>从基础 ACL 和高级 ACL 入手，讲清楚流量匹配、规则顺序、接口方向和验证方法。</description>
        <category>数通</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>DHCP 实验：地址池、网关、DNS 和中继配置怎么排查？</title>
        <link>https://www.zdyedu.cn/blog/hcia-datacom-dhcp-server-relay/</link>
        <guid>https://www.zdyedu.cn/blog/hcia-datacom-dhcp-server-relay/</guid>
        <description>从 DHCP 服务器和 DHCP Relay 两类场景出发，整理地址自动分配实验的关键配置与验证命令。</description>
        <category>数通</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Eth-Trunk 链路聚合实验：带宽提升和链路冗余怎么验证？</title>
        <link>https://www.zdyedu.cn/blog/hcia-datacom-eth-trunk-link-aggregation/</link>
        <guid>https://www.zdyedu.cn/blog/hcia-datacom-eth-trunk-link-aggregation/</guid>
        <description>从手工聚合和 LACP 思路出发，讲清楚 Eth-Trunk 的接口加入、负载分担和故障验证方法。</description>
        <category>数通</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>VLAN 间路由实验：二层隔离之后，三层互通应该怎么做？</title>
        <link>https://www.zdyedu.cn/blog/hcia-datacom-inter-vlan-routing/</link>
        <guid>https://www.zdyedu.cn/blog/hcia-datacom-inter-vlan-routing/</guid>
        <description>通过 Vlanif 三层网关实验，理解不同 VLAN 主机互通的前提、网关配置和排查路径。</description>
        <category>数通</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>NAT 出口访问实验：内网主机为什么能访问公网？</title>
        <link>https://www.zdyedu.cn/blog/hcia-datacom-nat-internet-access/</link>
        <guid>https://www.zdyedu.cn/blog/hcia-datacom-nat-internet-access/</guid>
        <description>通过源 NAT 和地址池实验，理解私网地址转换、ACL 匹配、出口接口和连通性排查。</description>
        <category>数通</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>数通实验排障流程：从物理链路到路由表的五步检查法</title>
        <link>https://www.zdyedu.cn/blog/hcia-datacom-network-troubleshooting-workflow/</link>
        <guid>https://www.zdyedu.cn/blog/hcia-datacom-network-troubleshooting-workflow/</guid>
        <description>把 HCIA-Datacom 常见实验问题整理成可复用的五步排障流程，适合初学者和一线网络运维。</description>
        <category>数通</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>OSPF 单区域实验：邻居为什么起不来，应该从哪里查？</title>
        <link>https://www.zdyedu.cn/blog/hcia-datacom-ospf-single-area-neighbor/</link>
        <guid>https://www.zdyedu.cn/blog/hcia-datacom-ospf-single-area-neighbor/</guid>
        <description>通过 OSPF 单区域配置，理解 Router ID、区域、网络宣告、邻居状态和常见不匹配问题。</description>
        <category>数通</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>设备远程管理实验：为什么建议用 SSH 替代 Telnet？</title>
        <link>https://www.zdyedu.cn/blog/hcia-datacom-ssh-secure-management/</link>
        <guid>https://www.zdyedu.cn/blog/hcia-datacom-ssh-secure-management/</guid>
        <description>围绕华为设备远程登录实验，讲清楚本地用户、VTY、认证方式、SSH 服务和安全加固要点。</description>
        <category>数通</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>静态路由与默认路由实验：小型网络为什么先从路由表开始排查？</title>
        <link>https://www.zdyedu.cn/blog/hcia-datacom-static-route-default-route/</link>
        <guid>https://www.zdyedu.cn/blog/hcia-datacom-static-route-default-route/</guid>
        <description>用静态路由和默认路由搭建跨网段通信实验，理解下一跳、出接口、路由优先级和连通性验证。</description>
        <category>数通</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>STP 实验：二层环路为什么危险，如何看懂根桥和端口状态？</title>
        <link>https://www.zdyedu.cn/blog/hcia-datacom-stp-loop-prevention/</link>
        <guid>https://www.zdyedu.cn/blog/hcia-datacom-stp-loop-prevention/</guid>
        <description>通过 STP/RSTP 的根桥选举、端口角色和状态变化，建立二层环路防护的实验排查框架。</description>
        <category>数通</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>VLAN 实验怎么做：Access、Trunk 和 Hybrid 的区别与验证</title>
        <link>https://www.zdyedu.cn/blog/hcia-datacom-vlan-access-trunk-hybrid/</link>
        <guid>https://www.zdyedu.cn/blog/hcia-datacom-vlan-access-trunk-hybrid/</guid>
        <description>围绕二层隔离场景，讲清楚 VLAN 创建、接口类型、Trunk 放行和 Hybrid 口的排查方法。</description>
        <category>数通</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>HCIA-Datacom 实验入门：华为 VRP 基础配置应该先掌握什么？</title>
        <link>https://www.zdyedu.cn/blog/hcia-datacom-vrp-basic-configuration/</link>
        <guid>https://www.zdyedu.cn/blog/hcia-datacom-vrp-basic-configuration/</guid>
        <description>从命令视图、设备命名、接口地址、配置保存和基础验证入手，建立华为数通实验的第一套操作习惯。</description>
        <category>数通</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>HCIP 数通：BGP 协议详解、IBGP/EBGP 邻居建立与路由通告实战</title>
        <link>https://www.zdyedu.cn/blog/hcip-bgp-ibgp-ebgp-route-guide/</link>
        <guid>https://www.zdyedu.cn/blog/hcip-bgp-ibgp-ebgp-route-guide/</guid>
        <description>深入讲解 BGP（边界网关协议）的核心机制：BGP vs OSPF 的本质区别、IBGP 与 EBGP 邻居建立差异、BGP 路由通告规则（IBGP 水平分割）、Next-hop 属性问题与解决方案、BGP 路由属性（AS-Path/LOCAL_PREF/MED），覆盖华为 VRP 平台企业出口双线 BGP 配置。</description>
        <category>数通</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>HCIP 数通：BGP 路由策略进阶、Route-Policy、Community 属性实战</title>
        <link>https://www.zdyedu.cn/blog/hcip-bgp-route-policy-community-filter/</link>
        <guid>https://www.zdyedu.cn/blog/hcip-bgp-route-policy-community-filter/</guid>
        <description>深入讲解 BGP 路由策略的精细化控制：Route-Policy 与 Filter-Policy 的区别和使用场景、AS-Path Filter 过滤路由、Prefix-List 精确匹配前缀、Community 属性标记路由与策略联动、BGP 路由反射器配置，通过企业双运营商出口策略的完整案例演示路由策略的生产应用。</description>
        <category>数通</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>HCIP 数通：MPLS 标签转发原理、LDP 协议与 MPLS VPN 基础</title>
        <link>https://www.zdyedu.cn/blog/hcip-mpls-label-forwarding-ldp-guide/</link>
        <guid>https://www.zdyedu.cn/blog/hcip-mpls-label-forwarding-ldp-guide/</guid>
        <description>系统讲解 MPLS（多协议标签交换）的工作原理：标签格式与交换机制（LER/LSR/LSP）、LDP 协议标签分发过程、MPLS 转发表（LFIB）与 IP 路由表的关系、MPLS VPN（L3VPN）的 VRF 隔离与 PE-CE 路由交换，覆盖华为 VRP 平台 MPLS 基础配置。</description>
        <category>数通</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>HCIP 数通：OSPF 多区域设计、LSA 类型详解与 ABR/ASBR 实战</title>
        <link>https://www.zdyedu.cn/blog/hcip-ospf-multi-area-lsa-types/</link>
        <guid>https://www.zdyedu.cn/blog/hcip-ospf-multi-area-lsa-types/</guid>
        <description>深入讲解 OSPF 多区域架构：为什么要划分区域（LSDB 规模控制）、骨干区域 Area 0 的作用、ABR（区域边界路由器）与 ASBR（自治系统边界路由器）配置、6 种 LSA 类型详解（Type 1-7）、虚链路解决区域不连续问题，覆盖华为 VRP 平台完整配置命令。</description>
        <category>数通</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>HCIP 数通：QoS 流量质量保障、分类标记、队列调度与流量整形实战</title>
        <link>https://www.zdyedu.cn/blog/hcip-qos-traffic-classification-queue/</link>
        <guid>https://www.zdyedu.cn/blog/hcip-qos-traffic-classification-queue/</guid>
        <description>系统讲解 QoS（Quality of Service）的完整实现：流量分类（Class-Based Classification）、DSCP/802.1p 标记、PQ/WFQ/CBWFQ 队列调度原理与对比、流量整形（Traffic Shaping）与限速（Traffic Policing）的差异，以及语音/视频/数据业务的典型 QoS 策略配置。</description>
        <category>数通</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>HCIP 数通：VRRP 网关冗余实战、主备切换、BFD 联动与负载分担</title>
        <link>https://www.zdyedu.cn/blog/hcip-vrrp-gateway-redundancy-bfd/</link>
        <guid>https://www.zdyedu.cn/blog/hcip-vrrp-gateway-redundancy-bfd/</guid>
        <description>深入讲解 VRRP（虚拟路由冗余协议）的工作原理与企业级配置：Master/Backup 主备选举、Priority 优先级抢占、接口监控触发主备切换、双 VRRP 组实现负载分担、BFD 联动实现毫秒级故障检测，覆盖华为 VRP 平台完整配置场景。</description>
        <category>数通</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>海光 DCU 兼容 CUDA 生态迁移实战指南</title>
        <link>https://www.zdyedu.cn/blog/hygon-dcu-cuda-migration-guide/</link>
        <guid>https://www.zdyedu.cn/blog/hygon-dcu-cuda-migration-guide/</guid>
        <description>系统讲解海光 DCU（深算系列）的 ROCm 兼容架构原理、从 CUDA 代码迁移到 DTK 的实操步骤、主流 AI 框架的 DCU 适配方法，以及在国产 DCU 上运行 PyTorch、vLLM 的实战配置。</description>
        <category>AI基础设施</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Kubernetes DRA 是什么？GPU 调度为什么要关注它？</title>
        <link>https://www.zdyedu.cn/blog/kubernetes-dra-gpu-scheduling-ops-guide/</link>
        <guid>https://www.zdyedu.cn/blog/kubernetes-dra-gpu-scheduling-ops-guide/</guid>
        <description>Dynamic Resource Allocation 已在 Kubernetes v1.35 稳定，v1.36 继续增强扩展资源和设备绑定能力。本文从 GPU 运维角度解释 DRA 的价值、对象和排查重点。</description>
        <category>Kubernetes</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Kubernetes 细粒度 kubelet 授权：为什么监控权限不能再粗放配置？</title>
        <link>https://www.zdyedu.cn/blog/kubernetes-fine-grained-kubelet-authz-ops-guide/</link>
        <guid>https://www.zdyedu.cn/blog/kubernetes-fine-grained-kubelet-authz-ops-guide/</guid>
        <description>Kubernetes 1.36 中细粒度 kubelet API 授权进入 GA，本文从运维视角解释它对监控、安全和最小权限的影响。</description>
        <category>Kubernetes</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Kubernetes 多租户设计：Namespace 隔离、ResourceQuota、LimitRange 实战</title>
        <link>https://www.zdyedu.cn/blog/kubernetes-multi-tenancy-namespace-quota-design/</link>
        <guid>https://www.zdyedu.cn/blog/kubernetes-multi-tenancy-namespace-quota-design/</guid>
        <description>系统讲解 Kubernetes 多租户架构设计：Namespace 资源隔离边界、ResourceQuota 配额控制防止资源抢占、LimitRange 设置默认资源限制、网络策略隔离租户流量，结合 RBAC 构建企业级多团队 K8s 平台的完整方案。</description>
        <category>Kubernetes</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Kubernetes 网络故障排查：DNS 解析、Service 连通、CNI 深度调试</title>
        <link>https://www.zdyedu.cn/blog/kubernetes-network-troubleshooting-dns-service/</link>
        <guid>https://www.zdyedu.cn/blog/kubernetes-network-troubleshooting-dns-service/</guid>
        <description>系统讲解 Kubernetes 网络故障排查方法：CoreDNS 解析失败定位、Service ClusterIP/NodePort/LoadBalancer 不通排查、Pod 间网络不通、CNI 插件问题调试，提供完整的诊断命令和排查思路，覆盖生产中 90% 的 K8s 网络故障场景。</description>
        <category>Kubernetes</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>K8s 可观测性黄金法则：RED/USE 方法与 SLO 实战</title>
        <link>https://www.zdyedu.cn/blog/kubernetes-observability-slo-red-use-guide/</link>
        <guid>https://www.zdyedu.cn/blog/kubernetes-observability-slo-red-use-guide/</guid>
        <description>系统讲解生产可观测性体系的方法论与实践：RED 方法（Rate/Error/Duration）面向用户服务监控、USE 方法（Utilization/Saturation/Error）面向基础设施资源监控、SLO（服务等级目标）设计与错误预算计算、Prometheus 中的 SLI 指标配置、AlertManager 基于错误预算的告警策略，帮助从&quot;指标收集&quot;升级到&quot;面向 SLO 的可观测性体系&quot;。</description>
        <category>监控告警</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Kubernetes Operator 开发入门：kubebuilder 实战从 CRD 到控制器</title>
        <link>https://www.zdyedu.cn/blog/kubernetes-operator-development-kubebuilder/</link>
        <guid>https://www.zdyedu.cn/blog/kubernetes-operator-development-kubebuilder/</guid>
        <description>从零开始学习 Kubernetes Operator 开发：用 kubebuilder 脚手架创建项目、定义 CRD（自定义资源）、实现 Reconcile 控制循环、部署 Operator 到集群，通过一个完整的 AppDeployment Operator 示例，掌握 K8s 扩展开发的核心模式。</description>
        <category>云原生</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Kubernetes RBAC 精细化权限管理实战：Role、ClusterRole、ServiceAccount</title>
        <link>https://www.zdyedu.cn/blog/kubernetes-rbac-fine-grained-access-control/</link>
        <guid>https://www.zdyedu.cn/blog/kubernetes-rbac-fine-grained-access-control/</guid>
        <description>深入讲解 Kubernetes RBAC 权限体系：Role/ClusterRole 定义权限规则、RoleBinding/ClusterRoleBinding 绑定权限、ServiceAccount 为工作负载授权，通过多租户场景、CI/CD 最小权限、运维只读账号等生产案例，掌握 K8s 精细化访问控制。</description>
        <category>Kubernetes</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Kubernetes Resource Health Status：GPU 和设备故障排查为什么更清晰了？</title>
        <link>https://www.zdyedu.cn/blog/kubernetes-resource-health-status-device-troubleshooting/</link>
        <guid>https://www.zdyedu.cn/blog/kubernetes-resource-health-status-device-troubleshooting/</guid>
        <description>Kubernetes 1.36 推进 Resource Health Status，帮助运维人员把 Pod 异常与底层设备健康状态关联起来，尤其适合 GPU、网卡和专用加速卡场景。</description>
        <category>Kubernetes</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Kubernetes 调度进阶：NodeAffinity、Taint/Toleration、PodTopologySpread 实战</title>
        <link>https://www.zdyedu.cn/blog/kubernetes-scheduling-affinity-taint-toleration/</link>
        <guid>https://www.zdyedu.cn/blog/kubernetes-scheduling-affinity-taint-toleration/</guid>
        <description>深入讲解 Kubernetes 高级调度机制：NodeSelector/NodeAffinity 精确选节点、Taint/Toleration 实现专属节点池、PodAffinity/AntiAffinity 控制 Pod 间关系、PodTopologySpread 实现跨区域均匀分布，覆盖 GPU 节点隔离、高可用跨 AZ 部署等生产场景。</description>
        <category>Kubernetes</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Kubernetes 存储实战：PV、PVC、StorageClass 与动态供给</title>
        <link>https://www.zdyedu.cn/blog/kubernetes-storage-pv-pvc-storageclass-guide/</link>
        <guid>https://www.zdyedu.cn/blog/kubernetes-storage-pv-pvc-storageclass-guide/</guid>
        <description>系统讲解 Kubernetes 存储体系：PersistentVolume 静态供给、StorageClass 动态供给、PVC 存储申请、访问模式与回收策略，覆盖 NFS、Ceph RBD、阿里云 CSI 等主流存储后端，以及 StatefulSet 有状态存储、数据备份迁移等生产实战场景。</description>
        <category>Kubernetes</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>KVM 虚拟机热迁移实战：virsh migrate、共享存储配置、迁移故障排查</title>
        <link>https://www.zdyedu.cn/blog/kvm-live-migration-shared-storage-guide/</link>
        <guid>https://www.zdyedu.cn/blog/kvm-live-migration-shared-storage-guide/</guid>
        <description>详解 KVM 虚拟机热迁移（Live Migration）的实现原理和操作流程：基于共享存储（NFS/Ceph）的热迁移、无共享存储的块迁移、virsh migrate 命令参数详解、迁移前检查、常见错误处理，覆盖 Proxmox VE 和裸 KVM 两种场景。</description>
        <category>虚拟化</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>KVM PCIe 直通与 SR-IOV：GPU 透传、网卡虚拟化实战</title>
        <link>https://www.zdyedu.cn/blog/kvm-pcie-passthrough-sr-iov-guide/</link>
        <guid>https://www.zdyedu.cn/blog/kvm-pcie-passthrough-sr-iov-guide/</guid>
        <description>详解 KVM 虚拟化中的 PCIe 设备直通（Passthrough）和 SR-IOV（单根 IO 虚拟化）技术：IOMMU 启用、VFIO 驱动绑定、GPU 完整透传给虚拟机、SR-IOV 网卡创建 VF 并分配给多个 VM，覆盖 NVIDIA GPU 透传、Intel/Mellanox 网卡 SR-IOV 配置全流程。</description>
        <category>虚拟化</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>KVM、QEMU、libvirt 是什么关系？虚拟化入门必须分清</title>
        <link>https://www.zdyedu.cn/blog/kvm-qemu-libvirt-relationship/</link>
        <guid>https://www.zdyedu.cn/blog/kvm-qemu-libvirt-relationship/</guid>
        <description>KVM、QEMU、libvirt 经常一起出现，但它们职责不同。理解三者关系，是学习 Linux 虚拟化的第一步。</description>
        <category>虚拟化</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>KVM 存储性能调优：qcow2 vs raw、IO 缓存模式、virtio 驱动对比</title>
        <link>https://www.zdyedu.cn/blog/kvm-storage-performance-qcow2-raw-virtio/</link>
        <guid>https://www.zdyedu.cn/blog/kvm-storage-performance-qcow2-raw-virtio/</guid>
        <description>深入讲解 KVM 虚拟机存储性能优化：qcow2 与 raw 格式性能对比与选型、cache=none/writeback/writethrough 缓存模式分析、virtio-blk vs virtio-scsi vs IDE 驱动性能差异、IO 多队列（iothread）配置，以及数据库场景的最优存储配置实践。</description>
        <category>虚拟化</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Linux ACL 与 sudo 细粒度权限管理实战</title>
        <link>https://www.zdyedu.cn/blog/linux-acl-sudo-advanced-permission-guide/</link>
        <guid>https://www.zdyedu.cn/blog/linux-acl-sudo-advanced-permission-guide/</guid>
        <description>在 chmod/chown 之上深入讲解 Linux 扩展访问控制列表（ACL）的配置与排查，以及 sudoers 文件的精细化授权——包括按用户、按命令、按时间窗口的最小权限配置，适用于多人协作的生产服务器。</description>
        <category>Linux</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Linux cgroup v2 进程资源控制实战：CPU、内存、IO 限速</title>
        <link>https://www.zdyedu.cn/blog/linux-cgroup-v2-resource-control-guide/</link>
        <guid>https://www.zdyedu.cn/blog/linux-cgroup-v2-resource-control-guide/</guid>
        <description>深入讲解 Linux cgroup v2（统一层级）的资源控制机制，包括 CPU 配额与权重、内存限制与 OOM 策略、IO 限速，以及如何用 systemd 单元文件和 cgroupfs 接口在生产环境中实现进程级资源隔离。</description>
        <category>Linux</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Linux LVM 逻辑卷管理实战：扩容、快照、迁移全流程</title>
        <link>https://www.zdyedu.cn/blog/linux-lvm-logical-volume-management-guide/</link>
        <guid>https://www.zdyedu.cn/blog/linux-lvm-logical-volume-management-guide/</guid>
        <description>深入讲解 LVM（逻辑卷管理器）的核心概念与生产操作：PV/VG/LV 的创建与管理、在线扩容不停机、LVM 快照备份、瘦配置（Thin Provisioning）、以及跨磁盘数据迁移的完整操作流程。</description>
        <category>Linux</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Linux 性能分析三件套：perf、火焰图、strace 实战</title>
        <link>https://www.zdyedu.cn/blog/linux-performance-perf-flamegraph-strace/</link>
        <guid>https://www.zdyedu.cn/blog/linux-performance-perf-flamegraph-strace/</guid>
        <description>系统讲解 Linux 性能分析的三个核心工具：perf 采样 CPU 热点、FlameGraph 可视化调用栈、strace/ltrace 追踪系统调用，通过真实案例演示如何定位 CPU 飙升、进程卡死、系统调用异常等生产级性能问题。</description>
        <category>Linux</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Linux 系统急救：rescue mode、GRUB 修复、fsck 完整操作手册</title>
        <link>https://www.zdyedu.cn/blog/linux-rescue-mode-system-recovery-guide/</link>
        <guid>https://www.zdyedu.cn/blog/linux-rescue-mode-system-recovery-guide/</guid>
        <description>详解 Linux 系统无法启动时的完整急救流程：GRUB 故障修复、rescue/emergency 模式进入、root 密码重置、文件系统损坏 fsck 修复、关键系统文件恢复，覆盖 Ubuntu/CentOS/RHEL 常见场景。</description>
        <category>Linux</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Linux sysctl 内核参数调优：Web 服务器与数据库生产配置</title>
        <link>https://www.zdyedu.cn/blog/linux-sysctl-kernel-tuning-production/</link>
        <guid>https://www.zdyedu.cn/blog/linux-sysctl-kernel-tuning-production/</guid>
        <description>系统讲解 Linux sysctl 内核参数的分类与调优方法，提供 Web 服务器（高并发）和数据库服务器的生产级参数配置，覆盖网络栈优化、内存管理、文件句柄、TCP 调优等核心参数，含完整的 sysctl.conf 配置模板。</description>
        <category>Linux</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>LLM 推理引擎横评：vLLM vs SGLang vs TensorRT-LLM 选型指南（2026）</title>
        <link>https://www.zdyedu.cn/blog/llm-inference-engine-comparison-vllm-sglang-trtllm/</link>
        <guid>https://www.zdyedu.cn/blog/llm-inference-engine-comparison-vllm-sglang-trtllm/</guid>
        <description>从吞吐量、延迟、显存效率、部署复杂度、功能特性四个维度全面对比三大主流 LLM 推理引擎，帮助运维和算法团队根据实际场景做出选型决策，覆盖在线 API、批处理、Reasoning 模型等典型场景。</description>
        <category>AI基础设施</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Loki 日志聚合实战：Promtail 采集、LogQL 查询与生产部署</title>
        <link>https://www.zdyedu.cn/blog/loki-log-aggregation-logql-guide/</link>
        <guid>https://www.zdyedu.cn/blog/loki-log-aggregation-logql-guide/</guid>
        <description>系统讲解 Grafana Loki 日志系统的生产部署：Loki 架构与存储原理（标签索引 vs 全文索引）、Promtail 多场景日志采集配置（Kubernetes/文件/系统日志）、LogQL 查询语言从基础到进阶、Loki 日志告警配置、Loki 分布式部署与存储配置（S3/阿里云 OSS 后端）。</description>
        <category>监控告警</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>NCCL 多 GPU 通信原理与分布式训练调优实践</title>
        <link>https://www.zdyedu.cn/blog/nccl-multi-gpu-communication-distributed-training/</link>
        <guid>https://www.zdyedu.cn/blog/nccl-multi-gpu-communication-distributed-training/</guid>
        <description>深入讲解 NCCL（NVIDIA Collective Communications Library）的核心通信原语、AllReduce/AllGather 算法选择、多节点 InfiniBand 配置与性能调优，以及 PyTorch FSDP 和 DeepSpeed ZeRO 中 NCCL 的实际使用建议。</description>
        <category>AI基础设施</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>NVIDIA MIG 多实例 GPU Kubernetes 进阶运维指南</title>
        <link>https://www.zdyedu.cn/blog/nvidia-mig-kubernetes-advanced-ops-guide/</link>
        <guid>https://www.zdyedu.cn/blog/nvidia-mig-kubernetes-advanced-ops-guide/</guid>
        <description>深入讲解 NVIDIA Multi-Instance GPU（MIG）在 Kubernetes 集群中的配置策略、Single/Mixed 模式实战、GPU Operator 自动化管理与多租户隔离最佳实践。</description>
        <category>AI基础设施</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Ollama 显存优化与模型选型：不同 GPU 配置下的最优方案</title>
        <link>https://www.zdyedu.cn/blog/ollama-deepseek-qwen3-gpu-memory-optimization/</link>
        <guid>https://www.zdyedu.cn/blog/ollama-deepseek-qwen3-gpu-memory-optimization/</guid>
        <description>根据实测数据给出不同显存配置（8GB/16GB/24GB/48GB/80GB）下的 Ollama 最优模型选型方案，讲解量化精度对质量和速度的影响、KV Cache 优化、多卡分布、以及如何用 CPU Offload 突破单卡显存限制。</description>
        <category>AI基础设施</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Ollama 本地大模型部署完全指南：从安装到 API 调用</title>
        <link>https://www.zdyedu.cn/blog/ollama-local-llm-deployment-guide/</link>
        <guid>https://www.zdyedu.cn/blog/ollama-local-llm-deployment-guide/</guid>
        <description>详细讲解 Ollama 的安装配置、主流模型（DeepSeek/Qwen3/Llama）的下载运行、REST API 和 OpenAI 兼容接口使用，以及多 GPU、自定义 Modelfile、模型量化选择等实用技巧，帮助团队快速搭建私有化 AI 推理服务。</description>
        <category>AI基础设施</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Open WebUI + Ollama：搭建企业私有 AI 助手平台</title>
        <link>https://www.zdyedu.cn/blog/ollama-open-webui-private-ai-setup/</link>
        <guid>https://www.zdyedu.cn/blog/ollama-open-webui-private-ai-setup/</guid>
        <description>完整讲解如何用 Open WebUI 在 Ollama 之上构建功能完备的私有 AI 平台，包括 Docker 部署、用户管理、多模型切换、文档 RAG、知识库、API Key 管理，以及 Kubernetes 生产级部署方案。</description>
        <category>AI基础设施</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>OpenTelemetry 分布式追踪实战：Jaeger 部署、链路分析与性能调优</title>
        <link>https://www.zdyedu.cn/blog/opentelemetry-jaeger-distributed-tracing-guide/</link>
        <guid>https://www.zdyedu.cn/blog/opentelemetry-jaeger-distributed-tracing-guide/</guid>
        <description>系统讲解分布式追踪的原理与实战：OpenTelemetry SDK 埋点（Go/Java/Python）、Jaeger 分布式追踪系统部署与配置、Trace/Span/Context 核心概念、W3C TraceContext 传播标准、采样策略配置（尾部采样/概率采样）、通过 Jaeger UI 分析慢请求和依赖关系图，以及 OTEL Collector 收集转发配置。</description>
        <category>监控告警</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Alertmanager 实战：告警路由、分组、静默与 PagerDuty/钉钉集成</title>
        <link>https://www.zdyedu.cn/blog/prometheus-alertmanager-routing-silence-guide/</link>
        <guid>https://www.zdyedu.cn/blog/prometheus-alertmanager-routing-silence-guide/</guid>
        <description>深入讲解 Prometheus Alertmanager 的核心能力：路由树（route tree）将不同告警分发到不同接收者、告警分组（grouping）合并同类告警减少噪音、静默（silence）和抑制（inhibition）规则、与钉钉/飞书/PagerDuty 集成，以及告警升级策略的完整生产配置。</description>
        <category>监控告警</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Prometheus 大规模优化：Recording Rules、Federation 与 Thanos 长期存储</title>
        <link>https://www.zdyedu.cn/blog/prometheus-thanos-large-scale-optimization/</link>
        <guid>https://www.zdyedu.cn/blog/prometheus-thanos-large-scale-optimization/</guid>
        <description>系统讲解 Prometheus 大规模生产优化方案：Recording Rules 预计算高频 PromQL 提升查询性能、Federation 联邦架构跨集群聚合、Thanos 组件（Sidecar/Store/Query/Compactor）实现无限长期存储与全局查询、Prometheus 内存和存储调优参数配置。</description>
        <category>监控告警</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Proxmox + Ceph 超融合生产实战：OSD 规划、网络隔离、性能调优</title>
        <link>https://www.zdyedu.cn/blog/proxmox-ceph-hyperconverged-production/</link>
        <guid>https://www.zdyedu.cn/blog/proxmox-ceph-hyperconverged-production/</guid>
        <description>深入讲解 Proxmox VE + Ceph 超融合基础设施的生产级部署：OSD 设备规划与 BlueStore 配置、集群网络与公共网络分离、CRUSH Map 数据分布策略、Pool 与 RBD 性能调优、常见故障恢复（OSD 宕机/PG 不健康/磁盘故障替换），覆盖 3 节点到 5 节点的真实企业场景。</description>
        <category>超融合</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Proxmox VE 高可用集群：HA Manager、节点 Fencing、VIP 漂移实战</title>
        <link>https://www.zdyedu.cn/blog/proxmox-ha-cluster-fencing-guide/</link>
        <guid>https://www.zdyedu.cn/blog/proxmox-ha-cluster-fencing-guide/</guid>
        <description>详解 Proxmox VE 高可用集群的构建与运维：Corosync 集群通信配置、HA Manager 自动故障转移原理、节点 Fencing（STONITH）防止脑裂、LVM-thin/Ceph 共享存储集成、HA 资源配置与优先级管理，覆盖节点宕机时的自动恢复流程。</description>
        <category>虚拟化</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>ROCm 7 vs CUDA 2026 开发者选型指南：差距有多大？</title>
        <link>https://www.zdyedu.cn/blog/rocm7-vs-cuda-developer-guide-2026/</link>
        <guid>https://www.zdyedu.cn/blog/rocm7-vs-cuda-developer-guide-2026/</guid>
        <description>基于 2026 年最新进展，从框架支持、性能对比、开发体验、生态成熟度四个维度全面对比 AMD ROCm 7 与 NVIDIA CUDA，帮助开发者和企业做出合理的 GPU 技术选型决策。</description>
        <category>AI基础设施</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>2026 虚拟化与超融合学习路线：从 KVM 到 HCI 运维</title>
        <link>https://www.zdyedu.cn/blog/virtualization-hci-learning-roadmap-2026/</link>
        <guid>https://www.zdyedu.cn/blog/virtualization-hci-learning-roadmap-2026/</guid>
        <description>虚拟化与超融合不是只会创建虚拟机，运维人员还要理解计算、存储、网络、HA、备份和容量规划。</description>
        <category>超融合</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>虚拟化 NUMA 深度调优：CPU Pin、大页内存、内存绑定实战</title>
        <link>https://www.zdyedu.cn/blog/virtualization-numa-cpu-pinning-hugepages/</link>
        <guid>https://www.zdyedu.cn/blog/virtualization-numa-cpu-pinning-hugepages/</guid>
        <description>深入讲解虚拟化平台的 NUMA（非统一内存访问）调优技术：NUMA 拓扑感知、vCPU 绑定到物理 CPU（CPU Pinning）、大页内存（Huge Pages）消除 TLB 压力、NUMA 内存绑定防止跨 NUMA 访问，通过低延迟数据库和高性能计算场景的完整配置，掌握虚拟机极致性能调优。</description>
        <category>虚拟化</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>vLLM 0.21 核心特性深度解析：KV Offload、Prefix Caching 与 Speculative Decoding</title>
        <link>https://www.zdyedu.cn/blog/vllm-0-21-core-features-deep-dive/</link>
        <guid>https://www.zdyedu.cn/blog/vllm-0-21-core-features-deep-dive/</guid>
        <description>深入解析 vLLM 0.21 三大核心新特性：基于 Hybrid Memory Allocator 的 KV Cache CPU Offload、默认开启的 Prefix Caching 工作原理与命中率优化，以及 Reasoning 模型的 Speculative Decoding 支持。</description>
        <category>AI基础设施</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>vLLM on Kubernetes 生产部署与 KEDA 弹性伸缩实战</title>
        <link>https://www.zdyedu.cn/blog/vllm-kubernetes-production-keda-autoscaling/</link>
        <guid>https://www.zdyedu.cn/blog/vllm-kubernetes-production-keda-autoscaling/</guid>
        <description>完整讲解 vLLM 0.21 在 Kubernetes 上的生产级部署方案，包括多 GPU Tensor Parallel 配置、Readiness/Liveness 探针设置、KEDA 基于 Prometheus 队列深度自动弹性伸缩，以及 FP8 精度与 Prefix Caching 生产调优。</description>
        <category>AI基础设施</category>
        <pubDate>Wed, 22 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Ansible 维护周期变化下，Playbook 升级前如何做兼容性检查</title>
        <link>https://www.zdyedu.cn/blog/ansible-core-2-21-maintenance-and-playbook-validation/</link>
        <guid>https://www.zdyedu.cn/blog/ansible-core-2-21-maintenance-and-playbook-validation/</guid>
        <description>结合 ansible-core 2.19 到 2.21 的维护信息，整理自动化运维中 Python 版本、模板行为、连接插件和 playbook 校验的升级清单。</description>
        <category>自动化运维</category>
        <pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>containerd 2.3 LTS 对 Kubernetes 运维意味着什么</title>
        <link>https://www.zdyedu.cn/blog/containerd-2-3-lts-kubernetes-runtime-upgrade/</link>
        <guid>https://www.zdyedu.cn/blog/containerd-2-3-lts-kubernetes-runtime-upgrade/</guid>
        <description>containerd 2.3 已进入 LTS 维护周期，本文解释 Kubernetes 节点运行时升级时需要关注的版本支持、CRI、runc、CNI 和回滚策略。</description>
        <category>云原生</category>
        <pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Microsoft Defender for Endpoint：Windows 终端安全运维要关注哪些能力</title>
        <link>https://www.zdyedu.cn/blog/defender-for-endpoint-windows-security-operations/</link>
        <guid>https://www.zdyedu.cn/blog/defender-for-endpoint-windows-security-operations/</guid>
        <description>Microsoft Defender for Endpoint 在 Windows 上提供下一代防护、EDR、自动调查响应和安全基线评估。本文整理运维落地重点。</description>
        <category>安全运维</category>
        <pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Docker Engine 29 运维升级重点：安全修复、containerd image store 与 cgroup v2</title>
        <link>https://www.zdyedu.cn/blog/docker-engine-29-security-upgrade-checklist/</link>
        <guid>https://www.zdyedu.cn/blog/docker-engine-29-security-upgrade-checklist/</guid>
        <description>Docker Engine 29 带来多项安全修复和行为变化，本文从运维角度整理升级前需要关注的风险点和验证清单。</description>
        <category>Docker</category>
        <pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>HAMi vGPU 容量规划：一张 GPU 到底能切给多少个任务？</title>
        <link>https://www.zdyedu.cn/blog/hami-vgpu-capacity-planning-guide/</link>
        <guid>https://www.zdyedu.cn/blog/hami-vgpu-capacity-planning-guide/</guid>
        <description>HAMi 支持在 Kubernetes 中对 GPU 等加速器做虚拟化和共享，本文从容量规划、隔离、监控和风险控制角度给出运维建议。</description>
        <category>AI基础设施</category>
        <pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Intune、Update Rings 与 Windows Autopatch：企业补丁管理怎么选</title>
        <link>https://www.zdyedu.cn/blog/intune-autopatch-windows-update-rings-guide/</link>
        <guid>https://www.zdyedu.cn/blog/intune-autopatch-windows-update-rings-guide/</guid>
        <description>Microsoft Intune 支持 Update rings、Feature updates、Quality updates、Driver updates 和 Expedite policies。本文解释这些能力与 Windows Autopatch 的区别。</description>
        <category>Windows 运维</category>
        <pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Kubernetes 1.36 运维升级清单：从安全授权到存储快照</title>
        <link>https://www.zdyedu.cn/blog/kubernetes-1-36-ops-upgrade-checklist/</link>
        <guid>https://www.zdyedu.cn/blog/kubernetes-1-36-ops-upgrade-checklist/</guid>
        <description>结合 Kubernetes 1.36 的最新变化，整理运维团队升级前需要关注的 kubelet 授权、DRA、存储快照、SELinux 和 HPA scale to zero。</description>
        <category>Kubernetes</category>
        <pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Kubernetes Service ExternalIPs 将被弃用：运维为什么要尽快排查</title>
        <link>https://www.zdyedu.cn/blog/kubernetes-service-externalips-deprecation-security/</link>
        <guid>https://www.zdyedu.cn/blog/kubernetes-service-externalips-deprecation-security/</guid>
        <description>Kubernetes 1.36 宣布 Service ExternalIPs 的弃用和移除方向，本文解释它的安全风险、排查方法和替代方案。</description>
        <category>安全运维</category>
        <pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>llm-d 是什么？为什么说 LLM 推理正在云原生化？</title>
        <link>https://www.zdyedu.cn/blog/llm-d-kubernetes-llm-inference-ops-guide/</link>
        <guid>https://www.zdyedu.cn/blog/llm-d-kubernetes-llm-inference-ops-guide/</guid>
        <description>llm-d 已进入 CNCF Sandbox，它把分布式 LLM 推理作为 Kubernetes 原生工作负载来处理。本文解释它的能力、适用场景和运维关注点。</description>
        <category>云原生</category>
        <pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>NVIDIA GPU Operator：GPU 节点运维为什么不建议只靠手工装驱动？</title>
        <link>https://www.zdyedu.cn/blog/nvidia-gpu-operator-kubernetes-node-ops/</link>
        <guid>https://www.zdyedu.cn/blog/nvidia-gpu-operator-kubernetes-node-ops/</guid>
        <description>NVIDIA GPU Operator 能自动管理 Kubernetes GPU 节点所需的驱动、Container Toolkit、Device Plugin、DCGM 等组件。本文整理运维落地检查项。</description>
        <category>AI基础设施</category>
        <pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>OpenSSH 10 移除 DSA 支持：老服务器还能连吗</title>
        <link>https://www.zdyedu.cn/blog/openssh-10-dsa-removal-upgrade-impact/</link>
        <guid>https://www.zdyedu.cn/blog/openssh-10-dsa-removal-upgrade-impact/</guid>
        <description>OpenSSH 10 已移除弱 DSA 签名算法支持，本文解释升级后可能出现的连接失败、排查命令和 SSH 安全加固建议。</description>
        <category>安全运维</category>
        <pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>OpenSSL 4.0 与 3.5 LTS：服务器 TLS 维护该怎么选版本</title>
        <link>https://www.zdyedu.cn/blog/openssl-4-and-3-5-lts-security-maintenance/</link>
        <guid>https://www.zdyedu.cn/blog/openssl-4-and-3-5-lts-security-maintenance/</guid>
        <description>OpenSSL 4.0 已发布，同时 3.5 是 LTS 分支。本文解释运维在 Nginx、系统库和安全补丁维护中如何选择 OpenSSL 版本。</description>
        <category>安全运维</category>
        <pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>OpenTelemetry 毕业后，运维该如何重新理解可观测性</title>
        <link>https://www.zdyedu.cn/blog/opentelemetry-cncf-graduation-observability-roadmap/</link>
        <guid>https://www.zdyedu.cn/blog/opentelemetry-cncf-graduation-observability-roadmap/</guid>
        <description>CNCF 宣布 OpenTelemetry 毕业，本文面向运维学习者解释 traces、metrics、logs、Collector、OTLP 以及从传统监控迁移到可观测性的路径。</description>
        <category>监控告警</category>
        <pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>PowerShell 7.6 LTS：Windows 自动化脚本该升级了吗</title>
        <link>https://www.zdyedu.cn/blog/powershell-7-6-lts-windows-automation-upgrade/</link>
        <guid>https://www.zdyedu.cn/blog/powershell-7-6-lts-windows-automation-upgrade/</guid>
        <description>PowerShell 7.6 是基于 .NET 10 的 LTS 版本。本文解释 Windows 运维从 Windows PowerShell 5.1 或 PowerShell 7.4/7.5 迁移时的检查重点。</description>
        <category>自动化运维</category>
        <pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Prometheus 3 迁移清单：运维要关注哪些兼容性变化</title>
        <link>https://www.zdyedu.cn/blog/prometheus-3-migration-ops-checklist/</link>
        <guid>https://www.zdyedu.cn/blog/prometheus-3-migration-ops-checklist/</guid>
        <description>Prometheus 3 带来若干不兼容变化，本文从运维角度整理 feature flags、scrape target、GOMEMLIMIT、GOMAXPROCS、规则和告警的迁移检查。</description>
        <category>监控告警</category>
        <pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Proxmox VE 9.2 动态负载均衡：中小集群运维要关注什么？</title>
        <link>https://www.zdyedu.cn/blog/proxmox-ve-9-2-dynamic-load-balancer-ops/</link>
        <guid>https://www.zdyedu.cn/blog/proxmox-ve-9-2-dynamic-load-balancer-ops/</guid>
        <description>Proxmox VE 9.2 引入 Dynamic Load Balancer，本文从资源平衡、迁移风险和监控指标角度分析运维要点。</description>
        <category>虚拟化</category>
        <pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Proxmox VE 9 升级检查清单：从 Debian 13 到 Ceph Squid</title>
        <link>https://www.zdyedu.cn/blog/proxmox-ve-9-upgrade-checklist/</link>
        <guid>https://www.zdyedu.cn/blog/proxmox-ve-9-upgrade-checklist/</guid>
        <description>Proxmox VE 9 基于 Debian 13，包含 QEMU、Ceph、ZFS 等组件升级。生产升级前需要做兼容性和回滚准备。</description>
        <category>虚拟化</category>
        <pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Ubuntu 26.04 LTS 服务器升级前要检查什么</title>
        <link>https://www.zdyedu.cn/blog/ubuntu-26-04-lts-server-upgrade-guide/</link>
        <guid>https://www.zdyedu.cn/blog/ubuntu-26-04-lts-server-upgrade-guide/</guid>
        <description>Ubuntu 26.04 LTS 已发布，本文面向 Linux 运维整理从 24.04 LTS 升级到 26.04 LTS 前需要关注的安全、内核、sudo-rs、rust-coreutils 和回滚准备。</description>
        <category>Linux</category>
        <pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Windows 11 25H2 与 26H1：企业终端升级路线怎么规划</title>
        <link>https://www.zdyedu.cn/blog/windows-11-25h2-26h1-servicing-roadmap/</link>
        <guid>https://www.zdyedu.cn/blog/windows-11-25h2-26h1-servicing-roadmap/</guid>
        <description>截至 2026 年 7 月，Windows 11 25H2 是面向现有设备的主要版本，26H1 主要面向 2026 年初上市的新设备。本文梳理企业终端升级和支持周期规划。</description>
        <category>Windows 运维</category>
        <pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Windows 11 Hotpatch：企业终端少重启补丁怎么落地</title>
        <link>https://www.zdyedu.cn/blog/windows-11-hotpatch-enterprise-ops-guide/</link>
        <guid>https://www.zdyedu.cn/blog/windows-11-hotpatch-enterprise-ops-guide/</guid>
        <description>Windows 11 Enterprise 24H2/25H2 支持 Hotpatch 日历。本文解释 baseline、hotpatch、适用范围和企业落地检查。</description>
        <category>Windows 运维</category>
        <pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>2026 年 7 月 Windows Patch Tuesday：终端补丁管理要看什么</title>
        <link>https://www.zdyedu.cn/blog/windows-july-2026-patch-tuesday-ops-checklist/</link>
        <guid>https://www.zdyedu.cn/blog/windows-july-2026-patch-tuesday-ops-checklist/</guid>
        <description>2026 年 7 月 Windows 累积更新覆盖 Windows 11 25H2、24H2 等版本。本文从企业运维角度整理补丁测试、暂停、加急和回滚检查。</description>
        <category>Windows 运维</category>
        <pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Windows LAPS：2026 年还在共用本地管理员密码就该改了</title>
        <link>https://www.zdyedu.cn/blog/windows-laps-2026-local-admin-password-guide/</link>
        <guid>https://www.zdyedu.cn/blog/windows-laps-2026-local-admin-password-guide/</guid>
        <description>Windows LAPS 已取代旧版 Microsoft LAPS，支持备份本地管理员密码到 AD 或 Microsoft Entra ID。本文讲解迁移、审计和运维检查。</description>
        <category>安全运维</category>
        <pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Windows Server 2025 AD DS 升级：域控迁移前要知道的新变化</title>
        <link>https://www.zdyedu.cn/blog/windows-server-2025-active-directory-upgrade-guide/</link>
        <guid>https://www.zdyedu.cn/blog/windows-server-2025-active-directory-upgrade-guide/</guid>
        <description>Windows Server 2025 带来 AD DS 数据库 32k page、LDAP 默认加密、TLS 1.3、Kerberos 配置变化等能力。本文整理域控升级前的检查重点。</description>
        <category>Windows 运维</category>
        <pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Windows Server 2025 安全基线：新服务器上线前检查这 10 项</title>
        <link>https://www.zdyedu.cn/blog/windows-server-2025-security-baseline-checklist/</link>
        <guid>https://www.zdyedu.cn/blog/windows-server-2025-security-baseline-checklist/</guid>
        <description>Windows Server 2025 带来 Credential Guard 默认启用、SMB 加固、Hotpatch preview 等安全能力。本文整理服务器上线前的运维检查清单。</description>
        <category>Windows 运维</category>
        <pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Windows Server 2025 SMB 加固：签名、加密、NTLM 阻断和 QUIC 怎么理解</title>
        <link>https://www.zdyedu.cn/blog/windows-server-2025-smb-hardening-guide/</link>
        <guid>https://www.zdyedu.cn/blog/windows-server-2025-smb-hardening-guide/</guid>
        <description>Windows Server 2025 与 Windows 11 24H2 强化了 SMB 安全默认值。本文解释 SMB signing、encryption、guest fallback、NTLM blocking、SMB over QUIC 和防火墙规则变化。</description>
        <category>安全运维</category>
        <pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Ceph OSD 容量水位怎么规划？超融合最怕磁盘快满</title>
        <link>https://www.zdyedu.cn/blog/ceph-osd-capacity-watermark-guide/</link>
        <guid>https://www.zdyedu.cn/blog/ceph-osd-capacity-watermark-guide/</guid>
        <description>Ceph 是超融合常见存储底座，容量水位、故障域和恢复空间规划不当，会直接影响集群稳定性。</description>
        <category>超融合</category>
        <pubDate>Mon, 20 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Ceph PG Degraded 怎么排查？超融合存储故障处理思路</title>
        <link>https://www.zdyedu.cn/blog/ceph-pg-degraded-troubleshooting/</link>
        <guid>https://www.zdyedu.cn/blog/ceph-pg-degraded-troubleshooting/</guid>
        <description>Ceph PG degraded 是超融合平台常见告警，排查时要结合 OSD、网络、磁盘、恢复队列和容量水位。</description>
        <category>超融合</category>
        <pubDate>Mon, 20 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>GPU 监控怎么做？DCGM Exporter、Prometheus 和 Grafana 运维入门</title>
        <link>https://www.zdyedu.cn/blog/dcgm-exporter-gpu-monitoring-prometheus-guide/</link>
        <guid>https://www.zdyedu.cn/blog/dcgm-exporter-gpu-monitoring-prometheus-guide/</guid>
        <description>GPU 集群不能只靠 nvidia-smi 手工查看。本文解释 DCGM Exporter 如何暴露 GPU 指标，以及 Prometheus 告警和 Grafana 看板应该关注哪些数据。</description>
        <category>监控告警</category>
        <pubDate>Mon, 20 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>GPU 驱动、CUDA 与容器运行时版本矩阵：为什么 AI 节点升级容易翻车？</title>
        <link>https://www.zdyedu.cn/blog/gpu-driver-cuda-container-runtime-version-matrix/</link>
        <guid>https://www.zdyedu.cn/blog/gpu-driver-cuda-container-runtime-version-matrix/</guid>
        <description>GPU 节点升级不能只看一个软件版本，驱动、CUDA、容器镜像、NVIDIA Container Toolkit 和 Kubernetes 组件都需要形成版本矩阵。</description>
        <category>AI基础设施</category>
        <pubDate>Mon, 20 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Kueue 如何管理 AI 训练任务：队列、配额和 GPU 批处理运维</title>
        <link>https://www.zdyedu.cn/blog/kueue-ai-batch-gpu-quota-ops-guide/</link>
        <guid>https://www.zdyedu.cn/blog/kueue-ai-batch-gpu-quota-ops-guide/</guid>
        <description>Kueue 是 Kubernetes 原生的作业排队和配额管理系统，适合 AI 训练、批处理和多租户 GPU 集群。本文解释 LocalQueue、ClusterQueue 和排障方法。</description>
        <category>Kubernetes</category>
        <pubDate>Mon, 20 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>超融合 Ceph 网络怎么设计？业务网、存储网和迁移网要不要分开</title>
        <link>https://www.zdyedu.cn/blog/ceph-network-design-hci/</link>
        <guid>https://www.zdyedu.cn/blog/ceph-network-design-hci/</guid>
        <description>Ceph 网络设计会影响虚拟机 IO 延迟、恢复速度和故障隔离，超融合平台应避免所有流量混在一张网里。</description>
        <category>超融合</category>
        <pubDate>Sun, 19 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>GPU 节点可观测性 SLI/SLO：不要只盯利用率</title>
        <link>https://www.zdyedu.cn/blog/gpu-node-observability-sli-slo-guide/</link>
        <guid>https://www.zdyedu.cn/blog/gpu-node-observability-sli-slo-guide/</guid>
        <description>GPU 利用率只是 AI 基础设施指标的一部分，生产环境还需要关注显存、温度、错误、排队、首 token 时间和任务成功率。</description>
        <category>AI基础设施</category>
        <pubDate>Sun, 19 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>GPU 服务器 Linux 运维上线前检查清单：驱动、CUDA、PCIe 和容器运行时</title>
        <link>https://www.zdyedu.cn/blog/gpu-server-linux-ops-preflight-checklist/</link>
        <guid>https://www.zdyedu.cn/blog/gpu-server-linux-ops-preflight-checklist/</guid>
        <description>GPU 服务器上线前不能只看 nvidia-smi。本文整理 Linux 运维需要检查的硬件识别、驱动版本、CUDA、PCIe、NUMA、容器运行时和压力测试。</description>
        <category>Linux</category>
        <pubDate>Sun, 19 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>超融合存储：三副本和纠删码怎么选？</title>
        <link>https://www.zdyedu.cn/blog/hci-storage-replica-vs-erasure-coding/</link>
        <guid>https://www.zdyedu.cn/blog/hci-storage-replica-vs-erasure-coding/</guid>
        <description>三副本和纠删码都能提供数据冗余，但在容量效率、写入性能、恢复复杂度和适用场景上差异很大。</description>
        <category>超融合</category>
        <pubDate>Sun, 19 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Inference Gateway 是什么？Kubernetes 模型服务入口为什么需要新能力？</title>
        <link>https://www.zdyedu.cn/blog/inference-gateway-kubernetes-model-serving-ops/</link>
        <guid>https://www.zdyedu.cn/blog/inference-gateway-kubernetes-model-serving-ops/</guid>
        <description>Kubernetes Gateway API Inference Extension 仍处于实验阶段，但它代表模型推理入口正在从普通 HTTP 路由走向推理感知路由。本文解释运维需要关注什么。</description>
        <category>云原生</category>
        <pubDate>Sun, 19 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Ubuntu Server 启动慢怎么排查？systemd-analyze 实战思路</title>
        <link>https://www.zdyedu.cn/blog/ubuntu-server-systemd-boot-troubleshooting/</link>
        <guid>https://www.zdyedu.cn/blog/ubuntu-server-systemd-boot-troubleshooting/</guid>
        <description>服务器重启后启动变慢，常见原因包括磁盘挂载、网络等待、服务依赖和 cloud-init，本文用 systemd-analyze 梳理排查路径。</description>
        <category>Linux</category>
        <pubDate>Sun, 19 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Kubernetes DRA 安全加固：ResourceClaim、RBAC 和设备权限怎么管？</title>
        <link>https://www.zdyedu.cn/blog/dra-security-hardening-rbac-resourceclaim-guide/</link>
        <guid>https://www.zdyedu.cn/blog/dra-security-hardening-rbac-resourceclaim-guide/</guid>
        <description>DRA 增强了 Kubernetes 设备管理能力，也带来新的授权边界。本文整理 DRA 安全加固中 ResourceClaim、状态更新和最小权限配置的运维重点。</description>
        <category>安全运维</category>
        <pubDate>Sat, 18 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Linux 时间同步为什么重要？chrony 在生产环境中的检查清单</title>
        <link>https://www.zdyedu.cn/blog/linux-chrony-time-sync-production-guide/</link>
        <guid>https://www.zdyedu.cn/blog/linux-chrony-time-sync-production-guide/</guid>
        <description>时间不同步会影响日志关联、证书、Kerberos、数据库和分布式系统，本文总结 chrony 的生产检查方法。</description>
        <category>Linux</category>
        <pubDate>Sat, 18 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Linux journald 日志保留策略：为什么磁盘总被日志打满？</title>
        <link>https://www.zdyedu.cn/blog/linux-journald-log-retention-guide/</link>
        <guid>https://www.zdyedu.cn/blog/linux-journald-log-retention-guide/</guid>
        <description>systemd-journald 默认策略不一定适合生产服务器，本文介绍日志占用、保留、清理和持久化配置的运维要点。</description>
        <category>Linux</category>
        <pubDate>Sat, 18 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>OpenTelemetry GenAI 可观测性：LLM 调用慢到底慢在哪里？</title>
        <link>https://www.zdyedu.cn/blog/opentelemetry-genai-observability-ops-guide/</link>
        <guid>https://www.zdyedu.cn/blog/opentelemetry-genai-observability-ops-guide/</guid>
        <description>OpenTelemetry 的 GenAI 语义约定正在标准化模型调用、token 使用、工具调用和延迟指标。本文解释 AI 应用运维如何建立观测体系。</description>
        <category>监控告警</category>
        <pubDate>Sat, 18 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>虚拟机热迁移前检查清单：为什么迁移不是简单点一下</title>
        <link>https://www.zdyedu.cn/blog/vm-live-migration-checklist/</link>
        <guid>https://www.zdyedu.cn/blog/vm-live-migration-checklist/</guid>
        <description>虚拟机热迁移依赖共享存储、网络带宽、CPU 兼容性和内存脏页收敛，生产环境迁移前要做检查。</description>
        <category>虚拟化</category>
        <pubDate>Sat, 18 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>虚拟机快照不是备份：生产环境别把两者混为一谈</title>
        <link>https://www.zdyedu.cn/blog/vm-snapshot-backup-difference/</link>
        <guid>https://www.zdyedu.cn/blog/vm-snapshot-backup-difference/</guid>
        <description>虚拟机快照适合短期回滚，备份适合灾难恢复。长期保留快照会影响性能和存储风险。</description>
        <category>虚拟化</category>
        <pubDate>Sat, 18 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Docker BuildKit 缓存怎么用？让镜像构建更快也更稳定</title>
        <link>https://www.zdyedu.cn/blog/docker-buildkit-cache-production-guide/</link>
        <guid>https://www.zdyedu.cn/blog/docker-buildkit-cache-production-guide/</guid>
        <description>BuildKit 已成为 Docker 构建的重要能力，合理使用缓存、上下文和多阶段构建，可以显著提升 CI/CD 镜像构建效率。</description>
        <category>Docker</category>
        <pubDate>Fri, 17 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Docker Compose 上生产环境？这些反模式要先避开</title>
        <link>https://www.zdyedu.cn/blog/docker-compose-production-anti-patterns/</link>
        <guid>https://www.zdyedu.cn/blog/docker-compose-production-anti-patterns/</guid>
        <description>Docker Compose 适合开发、测试和小规模部署，但生产使用时要注意网络、数据卷、日志、升级和恢复策略。</description>
        <category>Docker</category>
        <pubDate>Fri, 17 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Proxmox Backup Server 在超融合中的备份策略</title>
        <link>https://www.zdyedu.cn/blog/proxmox-backup-server-hci-strategy/</link>
        <guid>https://www.zdyedu.cn/blog/proxmox-backup-server-hci-strategy/</guid>
        <description>Proxmox Backup Server 适合为 Proxmox VE 提供去重、增量和校验能力，但备份网络、保留周期和异地副本仍需规划。</description>
        <category>超融合</category>
        <pubDate>Fri, 17 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>VMware Cloud Foundation 9.0：私有云为什么重新被重视？</title>
        <link>https://www.zdyedu.cn/blog/vmware-cloud-foundation-9-private-cloud/</link>
        <guid>https://www.zdyedu.cn/blog/vmware-cloud-foundation-9-private-cloud/</guid>
        <description>VMware Cloud Foundation 9.0 强调现代私有云，企业在成本、合规、AI 数据和本地性能之间重新评估基础设施。</description>
        <category>虚拟化</category>
        <pubDate>Fri, 17 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Docker 容器日志轮转：json-file 为什么会打满磁盘？</title>
        <link>https://www.zdyedu.cn/blog/docker-container-log-rotation-guide/</link>
        <guid>https://www.zdyedu.cn/blog/docker-container-log-rotation-guide/</guid>
        <description>Docker 默认 json-file 日志如果不限制大小，异常服务会快速占满磁盘。本文介绍日志轮转配置和排查方式。</description>
        <category>Docker</category>
        <pubDate>Thu, 16 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Docker Rootless 模式适合谁？容器安全运维入门</title>
        <link>https://www.zdyedu.cn/blog/docker-rootless-mode-security-guide/</link>
        <guid>https://www.zdyedu.cn/blog/docker-rootless-mode-security-guide/</guid>
        <description>Rootless Docker 可以降低 daemon 和容器对宿主机 root 权限的依赖，但在网络、存储和性能上也有边界。</description>
        <category>Docker</category>
        <pubDate>Thu, 16 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>OpenStack 2026.1 Gazpacho：私有云运维关注哪些变化？</title>
        <link>https://www.zdyedu.cn/blog/openstack-gazpacho-ops-highlights/</link>
        <guid>https://www.zdyedu.cn/blog/openstack-gazpacho-ops-highlights/</guid>
        <description>OpenStack 2026.1 Gazpacho 是 SLURP 版本，继续强化工作负载迁移、硬件支持和云运维能力。</description>
        <category>虚拟化</category>
        <pubDate>Thu, 16 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>事件驱动自动化：Ansible 不只是批量执行命令</title>
        <link>https://www.zdyedu.cn/blog/ansible-event-driven-automation-ops-guide/</link>
        <guid>https://www.zdyedu.cn/blog/ansible-event-driven-automation-ops-guide/</guid>
        <description>事件驱动自动化把监控告警、规则判断和自动处置连接起来，适合告警降噪、标准化恢复和运维流程提效。</description>
        <category>自动化运维</category>
        <pubDate>Wed, 15 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Gateway API 会替代 Ingress 吗？云原生入口网关升级思路</title>
        <link>https://www.zdyedu.cn/blog/cloud-native-gateway-api-ingress-migration/</link>
        <guid>https://www.zdyedu.cn/blog/cloud-native-gateway-api-ingress-migration/</guid>
        <description>Gateway API 正在成为 Kubernetes 入口流量治理的重要方向，本文从角色分工、路由能力和迁移策略解释它和 Ingress 的关系。</description>
        <category>云原生</category>
        <pubDate>Wed, 15 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Nutanix AHV 与超融合架构：为什么 HCI 强调一体化运维？</title>
        <link>https://www.zdyedu.cn/blog/nutanix-ahv-hci-architecture/</link>
        <guid>https://www.zdyedu.cn/blog/nutanix-ahv-hci-architecture/</guid>
        <description>Nutanix AHV 是超融合平台中的常见虚拟化选择，HCI 的重点是把计算、存储、虚拟化和管理体验整合起来。</description>
        <category>超融合</category>
        <pubDate>Wed, 15 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>OpenStack 和 Proxmox 怎么选？中小私有云别只看功能表</title>
        <link>https://www.zdyedu.cn/blog/openstack-vs-proxmox-small-private-cloud/</link>
        <guid>https://www.zdyedu.cn/blog/openstack-vs-proxmox-small-private-cloud/</guid>
        <description>OpenStack 和 Proxmox 都能建设私有云/虚拟化平台，但复杂度、团队能力、自动化和规模目标完全不同。</description>
        <category>虚拟化</category>
        <pubDate>Wed, 15 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>GitLab CI Cache 和 Artifacts 有什么区别？流水线提速别用错</title>
        <link>https://www.zdyedu.cn/blog/gitlab-ci-cache-artifacts-difference/</link>
        <guid>https://www.zdyedu.cn/blog/gitlab-ci-cache-artifacts-difference/</guid>
        <description>Cache 用于复用依赖和中间缓存，Artifacts 用于传递构建结果。理解两者区别，可以让 CI/CD 更快也更可靠。</description>
        <category>自动化运维</category>
        <pubDate>Tue, 14 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>超融合节点维护窗口怎么安排？升级重启前的检查清单</title>
        <link>https://www.zdyedu.cn/blog/hci-node-maintenance-window/</link>
        <guid>https://www.zdyedu.cn/blog/hci-node-maintenance-window/</guid>
        <description>超融合节点维护会同时影响计算和存储，维护前必须检查虚拟机迁移、存储健康、备份任务和容量水位。</description>
        <category>超融合</category>
        <pubDate>Tue, 14 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>三节点超融合集群安全吗？小规模 HCI 的风险边界</title>
        <link>https://www.zdyedu.cn/blog/hci-three-node-cluster-risk/</link>
        <guid>https://www.zdyedu.cn/blog/hci-three-node-cluster-risk/</guid>
        <description>三节点超融合是常见入门形态，但在维护、扩容、节点故障和容量水位方面有明显风险边界。</description>
        <category>超融合</category>
        <pubDate>Tue, 14 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Terraform State 为什么要加锁？基础设施自动化的隐形风险</title>
        <link>https://www.zdyedu.cn/blog/terraform-state-locking-backend-guide/</link>
        <guid>https://www.zdyedu.cn/blog/terraform-state-locking-backend-guide/</guid>
        <description>Terraform state 是基础设施真实状态的重要记录，团队协作时必须关注远程后端、状态锁、权限和备份。</description>
        <category>自动化运维</category>
        <pubDate>Tue, 14 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>超融合容量规划：CPU、内存和存储为什么不能分开算</title>
        <link>https://www.zdyedu.cn/blog/hci-capacity-planning-cpu-memory-storage/</link>
        <guid>https://www.zdyedu.cn/blog/hci-capacity-planning-cpu-memory-storage/</guid>
        <description>超融合节点同时承载计算和存储，容量规划要综合 CPU、内存、裸容量、副本、恢复空间和增长速度。</description>
        <category>超融合</category>
        <pubDate>Mon, 13 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>超融合平台监控指标：别只看虚拟机 CPU 和内存</title>
        <link>https://www.zdyedu.cn/blog/hci-monitoring-indicators/</link>
        <guid>https://www.zdyedu.cn/blog/hci-monitoring-indicators/</guid>
        <description>超融合监控要覆盖计算、存储、网络、虚拟机、备份和集群健康，单看 VM 指标远远不够。</description>
        <category>超融合</category>
        <pubDate>Mon, 13 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>网络故障排查：mtr、tcpdump 和 ss 应该怎么组合使用？</title>
        <link>https://www.zdyedu.cn/blog/network-troubleshooting-mtr-tcpdump-guide/</link>
        <guid>https://www.zdyedu.cn/blog/network-troubleshooting-mtr-tcpdump-guide/</guid>
        <description>网络问题不能只 ping，一线运维需要把路径质量、端口状态、连接队列和抓包证据结合起来判断。</description>
        <category>故障排查</category>
        <pubDate>Mon, 13 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Prometheus 告警疲劳怎么治理？从标签和分组开始</title>
        <link>https://www.zdyedu.cn/blog/prometheus-alert-fatigue-label-design/</link>
        <guid>https://www.zdyedu.cn/blog/prometheus-alert-fatigue-label-design/</guid>
        <description>告警太多不是监控成熟，而是信号质量差。Prometheus 告警治理要从标签、分组、抑制和 Runbook 做起。</description>
        <category>监控告警</category>
        <pubDate>Mon, 13 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>DNS 故障排查：dig、resolvectl 和 systemd-resolved 怎么看？</title>
        <link>https://www.zdyedu.cn/blog/dns-troubleshooting-dig-systemd-resolved/</link>
        <guid>https://www.zdyedu.cn/blog/dns-troubleshooting-dig-systemd-resolved/</guid>
        <description>DNS 问题会表现为应用超时、访问慢和证书异常，本文梳理 Linux 服务器上 DNS 排查的常用命令和思路。</description>
        <category>故障排查</category>
        <pubDate>Sun, 12 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Linux Load 很高但 CPU 不高，问题可能在哪里？</title>
        <link>https://www.zdyedu.cn/blog/linux-load-high-troubleshooting-guide/</link>
        <guid>https://www.zdyedu.cn/blog/linux-load-high-troubleshooting-guide/</guid>
        <description>Load Average 不等于 CPU 使用率。磁盘 IO、不可中断睡眠、进程排队和系统调用阻塞都可能导致 Load 升高。</description>
        <category>故障排查</category>
        <pubDate>Sun, 12 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>虚拟化 CPU 超分怎么设？别让宿主机长期满负载</title>
        <link>https://www.zdyedu.cn/blog/virtualization-cpu-overcommit-guide/</link>
        <guid>https://www.zdyedu.cn/blog/virtualization-cpu-overcommit-guide/</guid>
        <description>CPU 超分可以提升资源利用率，但过度超分会导致虚拟机调度等待、延迟升高和性能抖动。</description>
        <category>虚拟化</category>
        <pubDate>Sun, 12 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>虚拟化网络：VLAN、Linux Bridge 和 OVS 怎么理解？</title>
        <link>https://www.zdyedu.cn/blog/virtualization-network-vlan-bridge-ovs/</link>
        <guid>https://www.zdyedu.cn/blog/virtualization-network-vlan-bridge-ovs/</guid>
        <description>虚拟化网络排查离不开 VLAN、Bridge、OVS、Bond 和虚拟网卡。本文用运维视角梳理基础概念。</description>
        <category>虚拟化</category>
        <pubDate>Sun, 12 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Linux 特殊权限位：SUID、SGID、Sticky Bit 到底有什么用？</title>
        <link>https://www.zdyedu.cn/blog/linux-permission-special-bits-suid-sgid-sticky/</link>
        <guid>https://www.zdyedu.cn/blog/linux-permission-special-bits-suid-sgid-sticky/</guid>
        <description>除了 rwx，Linux 还有 SUID、SGID、Sticky Bit 等特殊权限位。理解它们是权限排查和安全加固的基础。</description>
        <category>Linux</category>
        <pubDate>Sat, 11 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>证书过期故障怎么排查？TLS 到期前应该监控什么</title>
        <link>https://www.zdyedu.cn/blog/tls-certificate-expiry-troubleshooting/</link>
        <guid>https://www.zdyedu.cn/blog/tls-certificate-expiry-troubleshooting/</guid>
        <description>TLS 证书过期会造成网站、API、内部服务和对象存储访问失败，本文总结证书检查、监控和续期流程。</description>
        <category>故障排查</category>
        <pubDate>Sat, 11 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>虚拟磁盘精简置备和厚置备怎么选？</title>
        <link>https://www.zdyedu.cn/blog/virtual-disk-thin-thick-provisioning/</link>
        <guid>https://www.zdyedu.cn/blog/virtual-disk-thin-thick-provisioning/</guid>
        <description>Thin Provisioning 节省空间，Thick Provisioning 更可预测。选择虚拟磁盘模式要结合存储水位、性能和运维风险。</description>
        <category>虚拟化</category>
        <pubDate>Sat, 11 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>虚拟化内存 Ballooning 是什么？什么时候会影响业务</title>
        <link>https://www.zdyedu.cn/blog/virtualization-memory-ballooning-guide/</link>
        <guid>https://www.zdyedu.cn/blog/virtualization-memory-ballooning-guide/</guid>
        <description>内存 Ballooning 可以回收虚拟机空闲内存，但宿主机内存压力过高时，会引发性能抖动和排查困难。</description>
        <category>虚拟化</category>
        <pubDate>Sat, 11 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Linux 目录结构入门：/etc、/var、/usr、/opt 分别放什么？</title>
        <link>https://www.zdyedu.cn/blog/linux-filesystem-hierarchy-beginner-guide/</link>
        <guid>https://www.zdyedu.cn/blog/linux-filesystem-hierarchy-beginner-guide/</guid>
        <description>理解 Linux 目录结构，有助于排查配置、日志、程序、数据和系统文件位置，是运维学习的基础能力。</description>
        <category>Linux</category>
        <pubDate>Fri, 10 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Linux 进程和信号入门：kill 不是只有 -9</title>
        <link>https://www.zdyedu.cn/blog/linux-process-signal-kill-guide/</link>
        <guid>https://www.zdyedu.cn/blog/linux-process-signal-kill-guide/</guid>
        <description>kill 命令本质是发送信号，理解 TERM、KILL、HUP、INT 等信号，有助于更安全地管理服务和进程。</description>
        <category>Linux</category>
        <pubDate>Fri, 10 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>2026 云原生学习路线：从 Linux 到 Kubernetes 再到 AI 基础设施</title>
        <link>https://www.zdyedu.cn/blog/cloud-native-learning-roadmap-2026/</link>
        <guid>https://www.zdyedu.cn/blog/cloud-native-learning-roadmap-2026/</guid>
        <description>云原生学习不能只背概念，建议从 Linux、容器、Kubernetes、可观测性、安全和 AI 基础设施逐步建立能力。</description>
        <category>学习路线</category>
        <pubDate>Thu, 09 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>虚拟化平台安全基线：管理口、权限和快照都要管</title>
        <link>https://www.zdyedu.cn/blog/virtualization-security-baseline/</link>
        <guid>https://www.zdyedu.cn/blog/virtualization-security-baseline/</guid>
        <description>虚拟化平台一旦被攻破，影响面通常大于单台服务器。安全基线要覆盖管理口、账号、网络隔离、补丁和备份。</description>
        <category>虚拟化</category>
        <pubDate>Thu, 09 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Windows 运维转云计算：Linux、自动化和 Kubernetes 应该怎么补？</title>
        <link>https://www.zdyedu.cn/blog/windows-linux-cloud-ops-career-roadmap/</link>
        <guid>https://www.zdyedu.cn/blog/windows-linux-cloud-ops-career-roadmap/</guid>
        <description>有 Windows 运维基础的人转向云计算并不难，关键是补齐 Linux、脚本、网络、容器和云原生运维能力。</description>
        <category>学习路线</category>
        <pubDate>Thu, 09 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>超融合平台如何防勒索？备份隔离比快照更重要</title>
        <link>https://www.zdyedu.cn/blog/hci-ransomware-backup-isolation/</link>
        <guid>https://www.zdyedu.cn/blog/hci-ransomware-backup-isolation/</guid>
        <description>勒索攻击会优先破坏虚拟化和备份平台，超融合环境必须设计账号隔离、备份隔离和恢复演练。</description>
        <category>超融合</category>
        <pubDate>Wed, 08 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>零基础 Linux 运维实验计划：不要只看视频，要搭环境</title>
        <link>https://www.zdyedu.cn/blog/junior-linux-ops-lab-plan/</link>
        <guid>https://www.zdyedu.cn/blog/junior-linux-ops-lab-plan/</guid>
        <description>学习 Linux 运维必须做实验，本文给出从虚拟机、网络、服务部署到故障排查的入门实验路径。</description>
        <category>学习路线</category>
        <pubDate>Wed, 08 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>CKA 备考路线：证书之外，真正要练的是 Kubernetes 排障能力</title>
        <link>https://www.zdyedu.cn/blog/kubernetes-cka-practice-roadmap-2026/</link>
        <guid>https://www.zdyedu.cn/blog/kubernetes-cka-practice-roadmap-2026/</guid>
        <description>CKA 能帮助学习者建立 Kubernetes 基础框架，但真正有价值的是通过实验掌握集群、网络、存储和故障排查。</description>
        <category>学习路线</category>
        <pubDate>Wed, 08 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>虚拟机模板和黄金镜像怎么管理？别让模板变成安全黑洞</title>
        <link>https://www.zdyedu.cn/blog/vm-template-golden-image-management/</link>
        <guid>https://www.zdyedu.cn/blog/vm-template-golden-image-management/</guid>
        <description>虚拟机模板能提升交付效率，但如果补丁、账号、密钥和初始化流程不规范，会放大安全和运维风险。</description>
        <category>虚拟化</category>
        <pubDate>Wed, 08 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>虚拟化灾备里的 RPO 和 RTO：老板问多久恢复，你怎么回答？</title>
        <link>https://www.zdyedu.cn/blog/disaster-recovery-rpo-rto-virtualization/</link>
        <guid>https://www.zdyedu.cn/blog/disaster-recovery-rpo-rto-virtualization/</guid>
        <description>RPO 和 RTO 是灾备设计核心指标。虚拟化平台要用备份、复制、演练和优先级来支撑恢复目标。</description>
        <category>超融合</category>
        <pubDate>Tue, 07 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>虚拟化性能问题：为什么很多时候根因是存储延迟？</title>
        <link>https://www.zdyedu.cn/blog/storage-latency-virtualization-performance/</link>
        <guid>https://www.zdyedu.cn/blog/storage-latency-virtualization-performance/</guid>
        <description>虚拟机卡顿不一定是 CPU 问题，存储延迟、快照链、备份任务和重平衡都可能影响业务体验。</description>
        <category>超融合</category>
        <pubDate>Mon, 06 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>超融合故障 Runbook 怎么写？从节点宕机到存储降级</title>
        <link>https://www.zdyedu.cn/blog/hci-runbook-incident-response/</link>
        <guid>https://www.zdyedu.cn/blog/hci-runbook-incident-response/</guid>
        <description>超融合故障处理需要标准 Runbook，把节点、存储、网络、虚拟机和备份检查步骤固化下来。</description>
        <category>超融合</category>
        <pubDate>Sun, 05 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>从 VMware 迁移到 Proxmox：不要只转换虚拟磁盘格式</title>
        <link>https://www.zdyedu.cn/blog/vmware-to-proxmox-migration-plan/</link>
        <guid>https://www.zdyedu.cn/blog/vmware-to-proxmox-migration-plan/</guid>
        <description>VMware 到 Proxmox 迁移涉及虚拟磁盘、网络、驱动、备份、回滚和业务验证，不能只看格式转换。</description>
        <category>虚拟化</category>
        <pubDate>Sun, 05 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Linux运维工程师学习路线：从零基础到能独立排障</title>
        <link>https://www.zdyedu.cn/blog/linux-ops-learning-roadmap/</link>
        <guid>https://www.zdyedu.cn/blog/linux-ops-learning-roadmap/</guid>
        <description>面向想学习 Linux 运维的同学，梳理从命令行、系统管理、网络服务到容器和 Kubernetes 的学习路线。</description>
        <category>学习路线</category>
        <pubDate>Wed, 01 Jul 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Linux文件权限怎么理解：chmod、chown和目录执行权限</title>
        <link>https://www.zdyedu.cn/blog/linux-file-permission-explained/</link>
        <guid>https://www.zdyedu.cn/blog/linux-file-permission-explained/</guid>
        <description>用实际运维场景解释 Linux 文件权限、目录权限、chmod、chown 和常见权限错误的排查方法。</description>
        <category>Linux</category>
        <pubDate>Mon, 29 Jun 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Linux服务器安全加固清单：上线前建议检查这10项</title>
        <link>https://www.zdyedu.cn/blog/linux-server-security-hardening-checklist/</link>
        <guid>https://www.zdyedu.cn/blog/linux-server-security-hardening-checklist/</guid>
        <description>整理 Linux 服务器上线前常见安全加固项，包括 SSH、防火墙、账号权限、日志、更新和备份。</description>
        <category>安全运维</category>
        <pubDate>Sat, 27 Jun 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Kubernetes入门先理解这5个概念：Pod、Deployment、Service、ConfigMap、Ingress</title>
        <link>https://www.zdyedu.cn/blog/kubernetes-beginner-core-concepts/</link>
        <guid>https://www.zdyedu.cn/blog/kubernetes-beginner-core-concepts/</guid>
        <description>为 Kubernetes 初学者解释 Pod、Deployment、Service、ConfigMap 和 Ingress 的作用，以及它们在应用发布中的关系。</description>
        <category>云原生</category>
        <pubDate>Thu, 25 Jun 2026 00:00:00 GMT</pubDate>
      </item>
      <item>
        <title>Linux服务器排障常用命令：从CPU、内存、磁盘到端口和日志</title>
        <link>https://www.zdyedu.cn/blog/linux-troubleshooting-common-commands/</link>
        <guid>https://www.zdyedu.cn/blog/linux-troubleshooting-common-commands/</guid>
        <description>整理 Linux 运维排障中最常用的命令，覆盖 CPU、内存、磁盘、网络端口、服务状态和日志定位。</description>
        <category>故障排查</category>
        <pubDate>Tue, 23 Jun 2026 00:00:00 GMT</pubDate>
      </item>
  </channel>
</rss>