技术博客
聚合 Linux、Windows、Kubernetes、云原生、安全运维和自动化实践,沉淀可检索、可复用的技术文章。
CUDA迁移到海光DCU实战:HIP编程模型、hipify工具与常见坑
系统讲解从NVIDIA CUDA迁移到海光DCU(ROCm/HIP)的完整实战流程:hipify-perl自动转换工具使用、HIP与CUDA API对照表、PyTorch/DeepSpeed DCU适配方法、分布式训练NCCL→RCCL迁移、迁移后性能调优(rocprof/rocblas调参),以及迁移难度评估方法论。
国产GPU 2025技术现状与运维挑战:910C、DCU3路线图与选型建议
深度分析2025-2026年国产GPU技术发展现状:华为昇腾910C规格与量产进展、海光DCU3(Z200系列)路线图、国产GPU与NVIDIA H100/H200的性能差距客观评估、AI算力国产化的现实挑战(算子、互联、软件生态),以及运维团队的实际应对建议。
国产GPU全景选型指南:昇腾/海光DCU/摩尔线程/寒武纪技术对比与生产选型
深度对比主流国产GPU厂商的技术路线与运维成熟度:华为昇腾910B/910C(CANN生态)、海光DCU(ROCm生态,CUDA迁移成本最低)、摩尔线程MTT S4000(MUSA架构)、寒武纪MLU370,从驱动生态、Kubernetes集成、软件兼容性、性能基准等维度给出选型决策建议。
国产GPU软件生态深度分析:CANN vs ROCm vs MUSA与CUDA的真实差距
客观分析2025年国产GPU软件生态的真实状态:CANN(昇腾)、ROCm/HIP(海光DCU)、MUSA(摩尔线程)三大生态与CUDA生态的深度对比,包括算子覆盖率、主流框架支持度、开发者工具链完整性、社区活跃度,以及对运维工程师的实际影响和应对建议。
eBPF 是什么:从零理解 Linux 内核可编程化
通俗讲解 eBPF 的核心原理、与传统内核模块的区别、安全验证机制,以及 eBPF 在网络观测、安全策略、性能追踪三大场景的实际应用,帮助运维工程师建立正确的 eBPF 认知框架。
FP8/FP4 量化生产推理实战:TensorRT ModelOpt 完全指南
深入讲解 NVIDIA TensorRT ModelOpt 的 FP8 与 FP4 量化原理、校准数据准备、生产导出流程,以及在 H100/H200/B200 上的性能提升数据,覆盖 Qwen3、Llama4 等主流模型的量化实践。
GitOps 是什么:从概念到 ArgoCD 快速入门
通俗讲解 GitOps 的核心理念、与传统 CI/CD 的区别,以及如何用 ArgoCD 在 Kubernetes 上实现声明式持续交付——从安装到第一个 Application 上线,含完整命令和配置示例。
GPU 节点故障自愈:Node Problem Detector 与自动隔离实战
详解如何在 Kubernetes GPU 集群中通过 Node Problem Detector(NPD)检测 GPU 故障、上报 NodeCondition、结合 Node Auto Remediation 实现节点自动隔离与修复,涵盖 NVIDIA XID 错误、ECC 故障、驱动崩溃等常见场景。
GPUStack 异构 GPU 集群管理实战:统一调度 NVIDIA/AMD/昇腾
介绍开源 GPU 集群管理器 GPUStack 的架构与核心功能,详解在混合 NVIDIA、AMD ROCm、华为昇腾 GPU 环境下统一部署 LLM 推理服务,以及显存感知调度、多节点推理与 OpenAI 兼容 API 实践。
Grafana Dashboard 设计最佳实践:变量、告警、Dashboard as Code
系统讲解 Grafana Dashboard 的专业设计方法:模板变量(Template Variables)实现动态下钻、Panel 类型选择与 PromQL 实战(时序图/Stat/Gauge/Heatmap)、Dashboard 告警配置、使用 Grafonnet 和 Terraform 实现 Dashboard as Code、Grafana 数据源代理与权限管理的生产配置。
HAMi 是什么?Kubernetes GPU 共享运维要关注哪些问题?
HAMi 已成为 CNCF Incubating 项目,面向 Kubernetes 提供 GPU 和异构加速器虚拟化能力。本文解释它解决的问题、核心组件和运维检查点。
ACL 访问控制实验:为什么匹配顺序比规则本身更重要?
从基础 ACL 和高级 ACL 入手,讲清楚流量匹配、规则顺序、接口方向和验证方法。
DHCP 实验:地址池、网关、DNS 和中继配置怎么排查?
从 DHCP 服务器和 DHCP Relay 两类场景出发,整理地址自动分配实验的关键配置与验证命令。
Eth-Trunk 链路聚合实验:带宽提升和链路冗余怎么验证?
从手工聚合和 LACP 思路出发,讲清楚 Eth-Trunk 的接口加入、负载分担和故障验证方法。
VLAN 间路由实验:二层隔离之后,三层互通应该怎么做?
通过 Vlanif 三层网关实验,理解不同 VLAN 主机互通的前提、网关配置和排查路径。
