AI基础设施
顶有教育科技AI基础设施分类文章,覆盖 Linux、Windows、Kubernetes、云原生、安全运维和自动化实践。当前分类共 34 篇文章,按发布时间从新到旧排列。
AMD GPU Operator + ROCm 7 Kubernetes 部署运维实践
完整介绍 AMD GPU Operator 1.5 在 Kubernetes 上的安装配置、ROCm 7 驱动管理、DRA 动态资源分配、自动节点修复(ANR)与监控指标接入,覆盖 MI300X 和 RDNA 4 工作站 GPU。
国产GPU大模型推理部署:vLLM在昇腾/DCU上的适配与性能调优
系统讲解在华为昇腾NPU和海光DCU上部署大语言模型推理服务的完整流程:vLLM Ascend/ROCm版本安装配置、主流LLM模型(Qwen2.5/LLaMA3/DeepSeek)的部署方法、PagedAttention显存优化、连续批处理性能调优,以及与NVIDIA A100的吞吐量对比分析。
昇腾NPU Kubernetes集成实战:Device Plugin、资源调度与Prometheus监控
详解华为昇腾NPU在Kubernetes中的完整集成方案:Ascend Device Plugin安装与配置、NPU资源调度(单卡/多卡/虚拟化vNPU)、NPU Exporter接入Prometheus监控、MindX DL训练任务调度、NPU隔离与健康检查,以及常见调度问题排查。
昇腾 NPU 接入 Kubernetes 运维全流程
从 ascend-device-plugin 安装、CANN 软件栈配置、NPU 健康检查到集群故障隔离,完整覆盖华为昇腾 910B/950 系列 NPU 在 Kubernetes 生产集群中的运维实践。
昇腾NPU运维故障排查实战:npu-smi诊断、训练卡死、通信异常处理
系统讲解华为昇腾NPU的生产运维故障排查方法:npu-smi深度使用(健康检查/温度/显存/AICore利用率)、训练任务卡死定位(AICore利用率为0排查链路)、HCCS集合通信异常、NPU设备故障隔离与替换、日志收集与上报华为支持,覆盖昇腾运维工程师日常最常见的问题场景。
CUDA迁移到海光DCU实战:HIP编程模型、hipify工具与常见坑
系统讲解从NVIDIA CUDA迁移到海光DCU(ROCm/HIP)的完整实战流程:hipify-perl自动转换工具使用、HIP与CUDA API对照表、PyTorch/DeepSpeed DCU适配方法、分布式训练NCCL→RCCL迁移、迁移后性能调优(rocprof/rocblas调参),以及迁移难度评估方法论。
国产GPU 2025技术现状与运维挑战:910C、DCU3路线图与选型建议
深度分析2025-2026年国产GPU技术发展现状:华为昇腾910C规格与量产进展、海光DCU3(Z200系列)路线图、国产GPU与NVIDIA H100/H200的性能差距客观评估、AI算力国产化的现实挑战(算子、互联、软件生态),以及运维团队的实际应对建议。
国产GPU全景选型指南:昇腾/海光DCU/摩尔线程/寒武纪技术对比与生产选型
深度对比主流国产GPU厂商的技术路线与运维成熟度:华为昇腾910B/910C(CANN生态)、海光DCU(ROCm生态,CUDA迁移成本最低)、摩尔线程MTT S4000(MUSA架构)、寒武纪MLU370,从驱动生态、Kubernetes集成、软件兼容性、性能基准等维度给出选型决策建议。
国产GPU软件生态深度分析:CANN vs ROCm vs MUSA与CUDA的真实差距
客观分析2025年国产GPU软件生态的真实状态:CANN(昇腾)、ROCm/HIP(海光DCU)、MUSA(摩尔线程)三大生态与CUDA生态的深度对比,包括算子覆盖率、主流框架支持度、开发者工具链完整性、社区活跃度,以及对运维工程师的实际影响和应对建议。
FP8/FP4 量化生产推理实战:TensorRT ModelOpt 完全指南
深入讲解 NVIDIA TensorRT ModelOpt 的 FP8 与 FP4 量化原理、校准数据准备、生产导出流程,以及在 H100/H200/B200 上的性能提升数据,覆盖 Qwen3、Llama4 等主流模型的量化实践。
GPUStack 异构 GPU 集群管理实战:统一调度 NVIDIA/AMD/昇腾
介绍开源 GPU 集群管理器 GPUStack 的架构与核心功能,详解在混合 NVIDIA、AMD ROCm、华为昇腾 GPU 环境下统一部署 LLM 推理服务,以及显存感知调度、多节点推理与 OpenAI 兼容 API 实践。
HAMi 是什么?Kubernetes GPU 共享运维要关注哪些问题?
HAMi 已成为 CNCF Incubating 项目,面向 Kubernetes 提供 GPU 和异构加速器虚拟化能力。本文解释它解决的问题、核心组件和运维检查点。
华为昇腾910B 驱动安装与CANN环境配置完整指南
详解华为昇腾NPU的完整运维配置流程:Ascend驱动和固件安装、CANN工具链(Toolkit/Kernels)配置、torch_npu安装与验证、npu-smi常用命令、MindX DL容器化部署,以及常见安装报错处理方法,适合首次接触昇腾环境的运维工程师。
混合异构GPU集群运维:NVIDIA+昇腾/DCU共存调度与统一管理
讲解生产环境中NVIDIA GPU与国产GPU(昇腾/海光DCU)混合部署的运维方案:Kubernetes多设备类型调度(不同Device Plugin共存)、通过标签/污点实现任务精准分发、统一监控面板(Prometheus+Grafana同时采集NVIDIA和NPU指标)、混合集群资源配额管理,以及国产GPU逐步替换NVIDIA的平滑迁移策略。
海光 DCU 兼容 CUDA 生态迁移实战指南
系统讲解海光 DCU(深算系列)的 ROCm 兼容架构原理、从 CUDA 代码迁移到 DTK 的实操步骤、主流 AI 框架的 DCU 适配方法,以及在国产 DCU 上运行 PyTorch、vLLM 的实战配置。
海光DCU Kubernetes集成实战:Device Plugin部署与推理服务调度
详解海光DCU在Kubernetes集群中的完整集成方案:DCU Device Plugin安装与验证、hy-smi指标接入Prometheus监控、推理服务Pod调度配置、多DCU并行任务(RCCL分布式通信)、DCU资源配额与LimitRange,以及节点故障时的任务自动迁移配置。
海光DCU + ROCm 环境配置实战:驱动安装、hy-smi监控与PyTorch验证
详解海光DCU(Deep Computing Unit)的完整运维配置流程:DCU驱动安装(dtk工具包)、ROCm环境配置、hy-smi监控命令、PyTorch for DCU安装与验证、DCU Kubernetes Device Plugin部署,以及DCU与NVIDIA GPU混合环境的管理策略。
LLM 推理引擎横评:vLLM vs SGLang vs TensorRT-LLM 选型指南(2026)
从吞吐量、延迟、显存效率、部署复杂度、功能特性四个维度全面对比三大主流 LLM 推理引擎,帮助运维和算法团队根据实际场景做出选型决策,覆盖在线 API、批处理、Reasoning 模型等典型场景。
摩尔线程MTT GPU运维实战:MUSA环境配置与Kubernetes集成
详解摩尔线程MTT S80/S4000 GPU的运维配置:MUSA SDK安装与环境配置、mthreads-gmi监控工具使用、PyTorch MUSA适配安装、Kubernetes Device Plugin部署、vLLM推理引擎在MUSA上的部署方法,以及常见兼容性问题的排查解决。
NCCL 多 GPU 通信原理与分布式训练调优实践
深入讲解 NCCL(NVIDIA Collective Communications Library)的核心通信原语、AllReduce/AllGather 算法选择、多节点 InfiniBand 配置与性能调优,以及 PyTorch FSDP 和 DeepSpeed ZeRO 中 NCCL 的实际使用建议。
NVIDIA+昇腾双栈Kubernetes调度实战:灰度迁移、流量分割与统一运维
深度讲解NVIDIA GPU与华为昇腾NPU在同一Kubernetes集群中的双栈调度方案:基于标签和污点的精准任务分发、推理服务的蓝绿切换(NVIDIA→昇腾逐步迁移)、Istio流量分割实现A/B测试、统一Prometheus监控(DCGM Exporter + NPU Exporter数据对齐)、双栈集群的运维SOP与故障应急预案。
NVIDIA MIG 多实例 GPU Kubernetes 进阶运维指南
深入讲解 NVIDIA Multi-Instance GPU(MIG)在 Kubernetes 集群中的配置策略、Single/Mixed 模式实战、GPU Operator 自动化管理与多租户隔离最佳实践。
Ollama 显存优化与模型选型:不同 GPU 配置下的最优方案
根据实测数据给出不同显存配置(8GB/16GB/24GB/48GB/80GB)下的 Ollama 最优模型选型方案,讲解量化精度对质量和速度的影响、KV Cache 优化、多卡分布、以及如何用 CPU Offload 突破单卡显存限制。
Ollama 本地大模型部署完全指南:从安装到 API 调用
详细讲解 Ollama 的安装配置、主流模型(DeepSeek/Qwen3/Llama)的下载运行、REST API 和 OpenAI 兼容接口使用,以及多 GPU、自定义 Modelfile、模型量化选择等实用技巧,帮助团队快速搭建私有化 AI 推理服务。
Open WebUI + Ollama:搭建企业私有 AI 助手平台
完整讲解如何用 Open WebUI 在 Ollama 之上构建功能完备的私有 AI 平台,包括 Docker 部署、用户管理、多模型切换、文档 RAG、知识库、API Key 管理,以及 Kubernetes 生产级部署方案。
ROCm 7 vs CUDA 2026 开发者选型指南:差距有多大?
基于 2026 年最新进展,从框架支持、性能对比、开发体验、生态成熟度四个维度全面对比 AMD ROCm 7 与 NVIDIA CUDA,帮助开发者和企业做出合理的 GPU 技术选型决策。
vLLM 0.21 核心特性深度解析:KV Offload、Prefix Caching 与 Speculative Decoding
深入解析 vLLM 0.21 三大核心新特性:基于 Hybrid Memory Allocator 的 KV Cache CPU Offload、默认开启的 Prefix Caching 工作原理与命中率优化,以及 Reasoning 模型的 Speculative Decoding 支持。
vLLM on Kubernetes 生产部署与 KEDA 弹性伸缩实战
完整讲解 vLLM 0.21 在 Kubernetes 上的生产级部署方案,包括多 GPU Tensor Parallel 配置、Readiness/Liveness 探针设置、KEDA 基于 Prometheus 队列深度自动弹性伸缩,以及 FP8 精度与 Prefix Caching 生产调优。
信创合规下的AI算力选型:昇腾/寒武纪认证体系与采购实战指南
系统讲解信创(国产化替代)场景下AI算力的合规要求与选型决策:信创目录认证流程、央企/政务云GPU采购规范、昇腾和寒武纪的信创认证状态、等保2.0对AI基础设施的要求、信创算力方案的性价比评估,以及如何向上级机构提交信创合规报告。
信创数据中心GPU运维规范:等保2.0、国密算法与审计日志实战
系统讲解信创AI算力数据中心的运维安全规范:等保2.0三级对GPU集群的具体要求(网络隔离/访问控制/日志审计)、Kubernetes审计日志配置与180天留存、国密算法在容器通信中的应用(SM4替代AES)、GPU节点漏洞扫描与合规基线检查、信创环境下的离线镜像管理,以及年度安全检查清单。
HAMi vGPU 容量规划:一张 GPU 到底能切给多少个任务?
HAMi 支持在 Kubernetes 中对 GPU 等加速器做虚拟化和共享,本文从容量规划、隔离、监控和风险控制角度给出运维建议。
NVIDIA GPU Operator:GPU 节点运维为什么不建议只靠手工装驱动?
NVIDIA GPU Operator 能自动管理 Kubernetes GPU 节点所需的驱动、Container Toolkit、Device Plugin、DCGM 等组件。本文整理运维落地检查项。
GPU 驱动、CUDA 与容器运行时版本矩阵:为什么 AI 节点升级容易翻车?
GPU 节点升级不能只看一个软件版本,驱动、CUDA、容器镜像、NVIDIA Container Toolkit 和 Kubernetes 组件都需要形成版本矩阵。
GPU 节点可观测性 SLI/SLO:不要只盯利用率
GPU 利用率只是 AI 基础设施指标的一部分,生产环境还需要关注显存、温度、错误、排队、首 token 时间和任务成功率。
