技术博客
聚合 Linux、Windows、Kubernetes、云原生、安全运维和自动化实践,沉淀可检索、可复用的技术文章。
AI 编程工具运维实战:Cursor、Claude Code 等工具的真实使用场景
从运维工程师视角评测 Cursor、Claude Code、GitHub Copilot 等 AI 编程工具在运维场景中的实际效果,包括 Shell 脚本生成、Dockerfile 优化、Kubernetes YAML 生成、日志分析自动化等典型场景的使用技巧和效率对比。
AI 工具生成 Kubernetes YAML 实战:从 Prompt 到生产可用配置
系统讲解如何用 AI 工具(Cursor、ChatGPT、Claude)高效生成生产级 Kubernetes YAML,包括 Prompt 工程技巧、常见资源类型的最佳实践模板、AI 生成内容的验证检查清单,以及 K8s GPT、kubectl-ai 等专业 K8s AI 工具的使用方法。
AMD GPU Operator + ROCm 7 Kubernetes 部署运维实践
完整介绍 AMD GPU Operator 1.5 在 Kubernetes 上的安装配置、ROCm 7 驱动管理、DRA 动态资源分配、自动节点修复(ANR)与监控指标接入,覆盖 MI300X 和 RDNA 4 工作站 GPU。
ArgoCD App of Apps 模式:多集群 GitOps 统一管理实战
详解 ArgoCD App of Apps 设计模式的原理和落地方案,包括如何用一个根 Application 管理所有子 Application、多集群注册与部署、ApplicationSet 大规模集群扩展、以及 ArgoCD Projects 的 RBAC 权限隔离。
ArgoCD 多环境部署实战:Helm + Kustomize 管理 Dev/Staging/Prod 差异
详解如何用 ArgoCD 配合 Helm values 文件或 Kustomize overlays 管理 dev/staging/production 三套环境的配置差异,包括镜像标签策略、环境变量注入、资源配额差异、ApplicationSet 批量管理,避免重复 YAML。
国产GPU大模型推理部署:vLLM在昇腾/DCU上的适配与性能调优
系统讲解在华为昇腾NPU和海光DCU上部署大语言模型推理服务的完整流程:vLLM Ascend/ROCm版本安装配置、主流LLM模型(Qwen2.5/LLaMA3/DeepSeek)的部署方法、PagedAttention显存优化、连续批处理性能调优,以及与NVIDIA A100的吞吐量对比分析。
昇腾NPU Kubernetes集成实战:Device Plugin、资源调度与Prometheus监控
详解华为昇腾NPU在Kubernetes中的完整集成方案:Ascend Device Plugin安装与配置、NPU资源调度(单卡/多卡/虚拟化vNPU)、NPU Exporter接入Prometheus监控、MindX DL训练任务调度、NPU隔离与健康检查,以及常见调度问题排查。
昇腾 NPU 接入 Kubernetes 运维全流程
从 ascend-device-plugin 安装、CANN 软件栈配置、NPU 健康检查到集群故障隔离,完整覆盖华为昇腾 910B/950 系列 NPU 在 Kubernetes 生产集群中的运维实践。
昇腾NPU运维故障排查实战:npu-smi诊断、训练卡死、通信异常处理
系统讲解华为昇腾NPU的生产运维故障排查方法:npu-smi深度使用(健康检查/温度/显存/AICore利用率)、训练任务卡死定位(AICore利用率为0排查链路)、HCCS集合通信异常、NPU设备故障隔离与替换、日志收集与上报华为支持,覆盖昇腾运维工程师日常最常见的问题场景。
Cilium 替换 Calico/Flannel 实战:基于 eBPF 的高性能 K8s 网络
完整讲解如何在 Kubernetes 集群中用 Cilium 替换 Calico 或 Flannel,包括 Helm 安装、kube-proxy 替换、Hubble 可观测性开启、以及与旧 CNI 迁移过程中的常见问题处理。
Cilium 零信任网络策略实战:L3/L4/L7 全栈访问控制
通过实际案例讲解如何用 CiliumNetworkPolicy 实现 Kubernetes 零信任网络,包括默认拒绝策略、基于标签的 L3/L4 控制、HTTP/gRPC 级别 L7 策略、DNS 策略和出口流量控制,覆盖微服务安全架构的核心场景。
Claude Code 运维自动化实战:让 AI 直接操作你的 Linux 服务器
实战讲解如何用 Claude Code(Anthropic 出品的终端 AI 代理)完成复杂运维任务:自动分析日志、批量修改配置、生成并执行监控脚本、自动化故障排查,以及在保证安全的前提下最大化 AI 的运维效率。
CUDA迁移到海光DCU实战:HIP编程模型、hipify工具与常见坑
系统讲解从NVIDIA CUDA迁移到海光DCU(ROCm/HIP)的完整实战流程:hipify-perl自动转换工具使用、HIP与CUDA API对照表、PyTorch/DeepSpeed DCU适配方法、分布式训练NCCL→RCCL迁移、迁移后性能调优(rocprof/rocblas调参),以及迁移难度评估方法论。
国产GPU 2025技术现状与运维挑战:910C、DCU3路线图与选型建议
深度分析2025-2026年国产GPU技术发展现状:华为昇腾910C规格与量产进展、海光DCU3(Z200系列)路线图、国产GPU与NVIDIA H100/H200的性能差距客观评估、AI算力国产化的现实挑战(算子、互联、软件生态),以及运维团队的实际应对建议。
国产GPU全景选型指南:昇腾/海光DCU/摩尔线程/寒武纪技术对比与生产选型
深度对比主流国产GPU厂商的技术路线与运维成熟度:华为昇腾910B/910C(CANN生态)、海光DCU(ROCm生态,CUDA迁移成本最低)、摩尔线程MTT S4000(MUSA架构)、寒武纪MLU370,从驱动生态、Kubernetes集成、软件兼容性、性能基准等维度给出选型决策建议。
