最新技术文章
把常见运维问题、学习路线和生产环境经验整理成可检索、可复用的内容。
AI 编程工具运维实战:Cursor、Claude Code 等工具的真实使用场景
从运维工程师视角评测 Cursor、Claude Code、GitHub Copilot 等 AI 编程工具在运维场景中的实际效果,包括 Shell 脚本生成、Dockerfile 优化、Kubernetes YAML 生成、日志分析自动化等典型场景的使用技巧和效率对比。
AI 工具生成 Kubernetes YAML 实战:从 Prompt 到生产可用配置
系统讲解如何用 AI 工具(Cursor、ChatGPT、Claude)高效生成生产级 Kubernetes YAML,包括 Prompt 工程技巧、常见资源类型的最佳实践模板、AI 生成内容的验证检查清单,以及 K8s GPT、kubectl-ai 等专业 K8s AI 工具的使用方法。
AMD GPU Operator + ROCm 7 Kubernetes 部署运维实践
完整介绍 AMD GPU Operator 1.5 在 Kubernetes 上的安装配置、ROCm 7 驱动管理、DRA 动态资源分配、自动节点修复(ANR)与监控指标接入,覆盖 MI300X 和 RDNA 4 工作站 GPU。
ArgoCD App of Apps 模式:多集群 GitOps 统一管理实战
详解 ArgoCD App of Apps 设计模式的原理和落地方案,包括如何用一个根 Application 管理所有子 Application、多集群注册与部署、ApplicationSet 大规模集群扩展、以及 ArgoCD Projects 的 RBAC 权限隔离。
ArgoCD 多环境部署实战:Helm + Kustomize 管理 Dev/Staging/Prod 差异
详解如何用 ArgoCD 配合 Helm values 文件或 Kustomize overlays 管理 dev/staging/production 三套环境的配置差异,包括镜像标签策略、环境变量注入、资源配额差异、ApplicationSet 批量管理,避免重复 YAML。
国产GPU大模型推理部署:vLLM在昇腾/DCU上的适配与性能调优
系统讲解在华为昇腾NPU和海光DCU上部署大语言模型推理服务的完整流程:vLLM Ascend/ROCm版本安装配置、主流LLM模型(Qwen2.5/LLaMA3/DeepSeek)的部署方法、PagedAttention显存优化、连续批处理性能调优,以及与NVIDIA A100的吞吐量对比分析。
昇腾NPU Kubernetes集成实战:Device Plugin、资源调度与Prometheus监控
详解华为昇腾NPU在Kubernetes中的完整集成方案:Ascend Device Plugin安装与配置、NPU资源调度(单卡/多卡/虚拟化vNPU)、NPU Exporter接入Prometheus监控、MindX DL训练任务调度、NPU隔离与健康检查,以及常见调度问题排查。
昇腾 NPU 接入 Kubernetes 运维全流程
从 ascend-device-plugin 安装、CANN 软件栈配置、NPU 健康检查到集群故障隔离,完整覆盖华为昇腾 910B/950 系列 NPU 在 Kubernetes 生产集群中的运维实践。
关于我们
武汉顶有教育科技有限公司是一家专注 Linux IT 技术培训的公司,课程体系覆盖 Linux 系统管理、云计算、云原生、存储与高可用、安全运维等方向。
开启您的技术之旅
课程咨询、企业合作、学习路线规划,欢迎联系顶有教育科技。
