Kubernetes
顶有教育科技Kubernetes分类文章,覆盖 Linux、Windows、Kubernetes、云原生、安全运维和自动化实践。当前分类共 12 篇文章,按发布时间从新到旧排列。
AI 工具生成 Kubernetes YAML 实战:从 Prompt 到生产可用配置
系统讲解如何用 AI 工具(Cursor、ChatGPT、Claude)高效生成生产级 Kubernetes YAML,包括 Prompt 工程技巧、常见资源类型的最佳实践模板、AI 生成内容的验证检查清单,以及 K8s GPT、kubectl-ai 等专业 K8s AI 工具的使用方法。
Cilium 替换 Calico/Flannel 实战:基于 eBPF 的高性能 K8s 网络
完整讲解如何在 Kubernetes 集群中用 Cilium 替换 Calico 或 Flannel,包括 Helm 安装、kube-proxy 替换、Hubble 可观测性开启、以及与旧 CNI 迁移过程中的常见问题处理。
Kubernetes DRA 是什么?GPU 调度为什么要关注它?
Dynamic Resource Allocation 已在 Kubernetes v1.35 稳定,v1.36 继续增强扩展资源和设备绑定能力。本文从 GPU 运维角度解释 DRA 的价值、对象和排查重点。
Kubernetes 细粒度 kubelet 授权:为什么监控权限不能再粗放配置?
Kubernetes 1.36 中细粒度 kubelet API 授权进入 GA,本文从运维视角解释它对监控、安全和最小权限的影响。
Kubernetes 多租户设计:Namespace 隔离、ResourceQuota、LimitRange 实战
系统讲解 Kubernetes 多租户架构设计:Namespace 资源隔离边界、ResourceQuota 配额控制防止资源抢占、LimitRange 设置默认资源限制、网络策略隔离租户流量,结合 RBAC 构建企业级多团队 K8s 平台的完整方案。
Kubernetes 网络故障排查:DNS 解析、Service 连通、CNI 深度调试
系统讲解 Kubernetes 网络故障排查方法:CoreDNS 解析失败定位、Service ClusterIP/NodePort/LoadBalancer 不通排查、Pod 间网络不通、CNI 插件问题调试,提供完整的诊断命令和排查思路,覆盖生产中 90% 的 K8s 网络故障场景。
Kubernetes RBAC 精细化权限管理实战:Role、ClusterRole、ServiceAccount
深入讲解 Kubernetes RBAC 权限体系:Role/ClusterRole 定义权限规则、RoleBinding/ClusterRoleBinding 绑定权限、ServiceAccount 为工作负载授权,通过多租户场景、CI/CD 最小权限、运维只读账号等生产案例,掌握 K8s 精细化访问控制。
Kubernetes Resource Health Status:GPU 和设备故障排查为什么更清晰了?
Kubernetes 1.36 推进 Resource Health Status,帮助运维人员把 Pod 异常与底层设备健康状态关联起来,尤其适合 GPU、网卡和专用加速卡场景。
Kubernetes 调度进阶:NodeAffinity、Taint/Toleration、PodTopologySpread 实战
深入讲解 Kubernetes 高级调度机制:NodeSelector/NodeAffinity 精确选节点、Taint/Toleration 实现专属节点池、PodAffinity/AntiAffinity 控制 Pod 间关系、PodTopologySpread 实现跨区域均匀分布,覆盖 GPU 节点隔离、高可用跨 AZ 部署等生产场景。
Kubernetes 存储实战:PV、PVC、StorageClass 与动态供给
系统讲解 Kubernetes 存储体系:PersistentVolume 静态供给、StorageClass 动态供给、PVC 存储申请、访问模式与回收策略,覆盖 NFS、Ceph RBD、阿里云 CSI 等主流存储后端,以及 StatefulSet 有状态存储、数据备份迁移等生产实战场景。
Kubernetes 1.36 运维升级清单:从安全授权到存储快照
结合 Kubernetes 1.36 的最新变化,整理运维团队升级前需要关注的 kubelet 授权、DRA、存储快照、SELinux 和 HPA scale to zero。
Kueue 如何管理 AI 训练任务:队列、配额和 GPU 批处理运维
Kueue 是 Kubernetes 原生的作业排队和配额管理系统,适合 AI 训练、批处理和多租户 GPU 集群。本文解释 LocalQueue、ClusterQueue 和排障方法。
