技术博客
聚合 Linux、Windows、Kubernetes、云原生、安全运维和自动化实践,沉淀可检索、可复用的技术文章。
海光DCU + ROCm 环境配置实战:驱动安装、hy-smi监控与PyTorch验证
详解海光DCU(Deep Computing Unit)的完整运维配置流程:DCU驱动安装(dtk工具包)、ROCm环境配置、hy-smi监控命令、PyTorch for DCU安装与验证、DCU Kubernetes Device Plugin部署,以及DCU与NVIDIA GPU混合环境的管理策略。
Kubernetes DRA 是什么?GPU 调度为什么要关注它?
Dynamic Resource Allocation 已在 Kubernetes v1.35 稳定,v1.36 继续增强扩展资源和设备绑定能力。本文从 GPU 运维角度解释 DRA 的价值、对象和排查重点。
Kubernetes 细粒度 kubelet 授权:为什么监控权限不能再粗放配置?
Kubernetes 1.36 中细粒度 kubelet API 授权进入 GA,本文从运维视角解释它对监控、安全和最小权限的影响。
Kubernetes 多租户设计:Namespace 隔离、ResourceQuota、LimitRange 实战
系统讲解 Kubernetes 多租户架构设计:Namespace 资源隔离边界、ResourceQuota 配额控制防止资源抢占、LimitRange 设置默认资源限制、网络策略隔离租户流量,结合 RBAC 构建企业级多团队 K8s 平台的完整方案。
Kubernetes 网络故障排查:DNS 解析、Service 连通、CNI 深度调试
系统讲解 Kubernetes 网络故障排查方法:CoreDNS 解析失败定位、Service ClusterIP/NodePort/LoadBalancer 不通排查、Pod 间网络不通、CNI 插件问题调试,提供完整的诊断命令和排查思路,覆盖生产中 90% 的 K8s 网络故障场景。
K8s 可观测性黄金法则:RED/USE 方法与 SLO 实战
系统讲解生产可观测性体系的方法论与实践:RED 方法(Rate/Error/Duration)面向用户服务监控、USE 方法(Utilization/Saturation/Error)面向基础设施资源监控、SLO(服务等级目标)设计与错误预算计算、Prometheus 中的 SLI 指标配置、AlertManager 基于错误预算的告警策略,帮助从"指标收集"升级到"面向 SLO 的可观测性体系"。
Kubernetes Operator 开发入门:kubebuilder 实战从 CRD 到控制器
从零开始学习 Kubernetes Operator 开发:用 kubebuilder 脚手架创建项目、定义 CRD(自定义资源)、实现 Reconcile 控制循环、部署 Operator 到集群,通过一个完整的 AppDeployment Operator 示例,掌握 K8s 扩展开发的核心模式。
Kubernetes RBAC 精细化权限管理实战:Role、ClusterRole、ServiceAccount
深入讲解 Kubernetes RBAC 权限体系:Role/ClusterRole 定义权限规则、RoleBinding/ClusterRoleBinding 绑定权限、ServiceAccount 为工作负载授权,通过多租户场景、CI/CD 最小权限、运维只读账号等生产案例,掌握 K8s 精细化访问控制。
Kubernetes Resource Health Status:GPU 和设备故障排查为什么更清晰了?
Kubernetes 1.36 推进 Resource Health Status,帮助运维人员把 Pod 异常与底层设备健康状态关联起来,尤其适合 GPU、网卡和专用加速卡场景。
Kubernetes 调度进阶:NodeAffinity、Taint/Toleration、PodTopologySpread 实战
深入讲解 Kubernetes 高级调度机制:NodeSelector/NodeAffinity 精确选节点、Taint/Toleration 实现专属节点池、PodAffinity/AntiAffinity 控制 Pod 间关系、PodTopologySpread 实现跨区域均匀分布,覆盖 GPU 节点隔离、高可用跨 AZ 部署等生产场景。
Kubernetes 存储实战:PV、PVC、StorageClass 与动态供给
系统讲解 Kubernetes 存储体系:PersistentVolume 静态供给、StorageClass 动态供给、PVC 存储申请、访问模式与回收策略,覆盖 NFS、Ceph RBD、阿里云 CSI 等主流存储后端,以及 StatefulSet 有状态存储、数据备份迁移等生产实战场景。
KVM 虚拟机热迁移实战:virsh migrate、共享存储配置、迁移故障排查
详解 KVM 虚拟机热迁移(Live Migration)的实现原理和操作流程:基于共享存储(NFS/Ceph)的热迁移、无共享存储的块迁移、virsh migrate 命令参数详解、迁移前检查、常见错误处理,覆盖 Proxmox VE 和裸 KVM 两种场景。
KVM PCIe 直通与 SR-IOV:GPU 透传、网卡虚拟化实战
详解 KVM 虚拟化中的 PCIe 设备直通(Passthrough)和 SR-IOV(单根 IO 虚拟化)技术:IOMMU 启用、VFIO 驱动绑定、GPU 完整透传给虚拟机、SR-IOV 网卡创建 VF 并分配给多个 VM,覆盖 NVIDIA GPU 透传、Intel/Mellanox 网卡 SR-IOV 配置全流程。
KVM、QEMU、libvirt 是什么关系?虚拟化入门必须分清
KVM、QEMU、libvirt 经常一起出现,但它们职责不同。理解三者关系,是学习 Linux 虚拟化的第一步。
KVM 存储性能调优:qcow2 vs raw、IO 缓存模式、virtio 驱动对比
深入讲解 KVM 虚拟机存储性能优化:qcow2 与 raw 格式性能对比与选型、cache=none/writeback/writethrough 缓存模式分析、virtio-blk vs virtio-scsi vs IDE 驱动性能差异、IO 多队列(iothread)配置,以及数据库场景的最优存储配置实践。
