AI基础设施

顶有教育科技AI基础设施分类文章,覆盖 Linux、Windows、Kubernetes、云原生、安全运维和自动化实践。当前分类共 34 篇文章,按发布时间从新到旧排列。

分类文章

返回全部文章

2026/7/22 · AI基础设施 · 约 14 分钟

AMD GPU Operator + ROCm 7 Kubernetes 部署运维实践

完整介绍 AMD GPU Operator 1.5 在 Kubernetes 上的安装配置、ROCm 7 驱动管理、DRA 动态资源分配、自动节点修复(ANR)与监控指标接入,覆盖 MI300X 和 RDNA 4 工作站 GPU。

AMDROCmKubernetesGPU OperatorDRAMI300X
2026/7/22 · AI基础设施 · 约 13 分钟

国产GPU大模型推理部署:vLLM在昇腾/DCU上的适配与性能调优

系统讲解在华为昇腾NPU和海光DCU上部署大语言模型推理服务的完整流程:vLLM Ascend/ROCm版本安装配置、主流LLM模型(Qwen2.5/LLaMA3/DeepSeek)的部署方法、PagedAttention显存优化、连续批处理性能调优,以及与NVIDIA A100的吞吐量对比分析。

vLLM昇腾海光DCU大模型推理LLMQwenAI基础设施国产GPU
2026/7/22 · AI基础设施 · 约 14 分钟

昇腾NPU Kubernetes集成实战:Device Plugin、资源调度与Prometheus监控

详解华为昇腾NPU在Kubernetes中的完整集成方案:Ascend Device Plugin安装与配置、NPU资源调度(单卡/多卡/虚拟化vNPU)、NPU Exporter接入Prometheus监控、MindX DL训练任务调度、NPU隔离与健康检查,以及常见调度问题排查。

昇腾AscendKubernetesDevice PluginNPU监控云原生AI基础设施
2026/7/22 · AI基础设施 · 约 15 分钟

昇腾 NPU 接入 Kubernetes 运维全流程

从 ascend-device-plugin 安装、CANN 软件栈配置、NPU 健康检查到集群故障隔离,完整覆盖华为昇腾 910B/950 系列 NPU 在 Kubernetes 生产集群中的运维实践。

昇腾NPUKubernetesCANN国产GPU华为
2026/7/22 · AI基础设施 · 约 13 分钟

昇腾NPU运维故障排查实战:npu-smi诊断、训练卡死、通信异常处理

系统讲解华为昇腾NPU的生产运维故障排查方法:npu-smi深度使用(健康检查/温度/显存/AICore利用率)、训练任务卡死定位(AICore利用率为0排查链路)、HCCS集合通信异常、NPU设备故障隔离与替换、日志收集与上报华为支持,覆盖昇腾运维工程师日常最常见的问题场景。

昇腾AscendNPU故障排查npu-smi运维AI基础设施HCCS
2026/7/22 · AI基础设施 · 约 13 分钟

CUDA迁移到海光DCU实战:HIP编程模型、hipify工具与常见坑

系统讲解从NVIDIA CUDA迁移到海光DCU(ROCm/HIP)的完整实战流程:hipify-perl自动转换工具使用、HIP与CUDA API对照表、PyTorch/DeepSpeed DCU适配方法、分布式训练NCCL→RCCL迁移、迁移后性能调优(rocprof/rocblas调参),以及迁移难度评估方法论。

海光DCUCUDAHIPROCm迁移AI基础设施国产GPU
2026/7/22 · AI基础设施 · 约 12 分钟

国产GPU 2025技术现状与运维挑战:910C、DCU3路线图与选型建议

深度分析2025-2026年国产GPU技术发展现状:华为昇腾910C规格与量产进展、海光DCU3(Z200系列)路线图、国产GPU与NVIDIA H100/H200的性能差距客观评估、AI算力国产化的现实挑战(算子、互联、软件生态),以及运维团队的实际应对建议。

国产GPU昇腾910C海光DCU华为AI基础设施信创国产化算力
2026/7/22 · AI基础设施 · 约 14 分钟

国产GPU全景选型指南:昇腾/海光DCU/摩尔线程/寒武纪技术对比与生产选型

深度对比主流国产GPU厂商的技术路线与运维成熟度:华为昇腾910B/910C(CANN生态)、海光DCU(ROCm生态,CUDA迁移成本最低)、摩尔线程MTT S4000(MUSA架构)、寒武纪MLU370,从驱动生态、Kubernetes集成、软件兼容性、性能基准等维度给出选型决策建议。

国产GPU昇腾海光DCU摩尔线程寒武纪选型AI基础设施信创
2026/7/22 · AI基础设施 · 约 13 分钟

国产GPU软件生态深度分析:CANN vs ROCm vs MUSA与CUDA的真实差距

客观分析2025年国产GPU软件生态的真实状态:CANN(昇腾)、ROCm/HIP(海光DCU)、MUSA(摩尔线程)三大生态与CUDA生态的深度对比,包括算子覆盖率、主流框架支持度、开发者工具链完整性、社区活跃度,以及对运维工程师的实际影响和应对建议。

国产GPUCANNROCmMUSACUDA生态分析AI基础设施软件栈
2026/7/22 · AI基础设施 · 约 14 分钟

FP8/FP4 量化生产推理实战:TensorRT ModelOpt 完全指南

深入讲解 NVIDIA TensorRT ModelOpt 的 FP8 与 FP4 量化原理、校准数据准备、生产导出流程,以及在 H100/H200/B200 上的性能提升数据,覆盖 Qwen3、Llama4 等主流模型的量化实践。

FP8FP4量化TensorRTModelOptLLM推理优化
2026/7/22 · AI基础设施 · 约 12 分钟

GPUStack 异构 GPU 集群管理实战:统一调度 NVIDIA/AMD/昇腾

介绍开源 GPU 集群管理器 GPUStack 的架构与核心功能,详解在混合 NVIDIA、AMD ROCm、华为昇腾 GPU 环境下统一部署 LLM 推理服务,以及显存感知调度、多节点推理与 OpenAI 兼容 API 实践。

GPUStack异构GPUNVIDIAAMD昇腾LLM调度
2026/7/22 · AI基础设施 · 9分钟阅读

HAMi 是什么?Kubernetes GPU 共享运维要关注哪些问题?

HAMi 已成为 CNCF Incubating 项目,面向 Kubernetes 提供 GPU 和异构加速器虚拟化能力。本文解释它解决的问题、核心组件和运维检查点。

HAMiGPU共享KubernetesCNCF
2026/7/22 · AI基础设施 · 约 13 分钟

华为昇腾910B 驱动安装与CANN环境配置完整指南

详解华为昇腾NPU的完整运维配置流程:Ascend驱动和固件安装、CANN工具链(Toolkit/Kernels)配置、torch_npu安装与验证、npu-smi常用命令、MindX DL容器化部署,以及常见安装报错处理方法,适合首次接触昇腾环境的运维工程师。

昇腾AscendCANNNPU华为AI基础设施驱动安装运维
2026/7/22 · AI基础设施 · 约 13 分钟

混合异构GPU集群运维:NVIDIA+昇腾/DCU共存调度与统一管理

讲解生产环境中NVIDIA GPU与国产GPU(昇腾/海光DCU)混合部署的运维方案:Kubernetes多设备类型调度(不同Device Plugin共存)、通过标签/污点实现任务精准分发、统一监控面板(Prometheus+Grafana同时采集NVIDIA和NPU指标)、混合集群资源配额管理,以及国产GPU逐步替换NVIDIA的平滑迁移策略。

国产GPU昇腾海光DCUNVIDIAKubernetes混合集群异构计算AI基础设施
2026/7/22 · AI基础设施 · 约 13 分钟

海光 DCU 兼容 CUDA 生态迁移实战指南

系统讲解海光 DCU(深算系列)的 ROCm 兼容架构原理、从 CUDA 代码迁移到 DTK 的实操步骤、主流 AI 框架的 DCU 适配方法,以及在国产 DCU 上运行 PyTorch、vLLM 的实战配置。

海光DCU国产GPUCUDA迁移信创深算
2026/7/22 · AI基础设施 · 约 12 分钟

海光DCU Kubernetes集成实战:Device Plugin部署与推理服务调度

详解海光DCU在Kubernetes集群中的完整集成方案:DCU Device Plugin安装与验证、hy-smi指标接入Prometheus监控、推理服务Pod调度配置、多DCU并行任务(RCCL分布式通信)、DCU资源配额与LimitRange,以及节点故障时的任务自动迁移配置。

海光DCUKubernetesDevice PluginROCm监控AI基础设施国产GPU
2026/7/22 · AI基础设施 · 约 13 分钟

海光DCU + ROCm 环境配置实战:驱动安装、hy-smi监控与PyTorch验证

详解海光DCU(Deep Computing Unit)的完整运维配置流程:DCU驱动安装(dtk工具包)、ROCm环境配置、hy-smi监控命令、PyTorch for DCU安装与验证、DCU Kubernetes Device Plugin部署,以及DCU与NVIDIA GPU混合环境的管理策略。

海光DCUROCm国产GPUAI基础设施驱动安装hy-smi运维
2026/7/22 · AI基础设施 · 约 14 分钟

LLM 推理引擎横评:vLLM vs SGLang vs TensorRT-LLM 选型指南(2026)

从吞吐量、延迟、显存效率、部署复杂度、功能特性四个维度全面对比三大主流 LLM 推理引擎,帮助运维和算法团队根据实际场景做出选型决策,覆盖在线 API、批处理、Reasoning 模型等典型场景。

vLLMSGLangTensorRT-LLMLLM推理推理引擎性能优化
2026/7/22 · AI基础设施 · 约 12 分钟

摩尔线程MTT GPU运维实战:MUSA环境配置与Kubernetes集成

详解摩尔线程MTT S80/S4000 GPU的运维配置:MUSA SDK安装与环境配置、mthreads-gmi监控工具使用、PyTorch MUSA适配安装、Kubernetes Device Plugin部署、vLLM推理引擎在MUSA上的部署方法,以及常见兼容性问题的排查解决。

摩尔线程Moore ThreadsMUSA国产GPUKubernetesAI推理AI基础设施
2026/7/22 · AI基础设施 · 约 14 分钟

NCCL 多 GPU 通信原理与分布式训练调优实践

深入讲解 NCCL(NVIDIA Collective Communications Library)的核心通信原语、AllReduce/AllGather 算法选择、多节点 InfiniBand 配置与性能调优,以及 PyTorch FSDP 和 DeepSpeed ZeRO 中 NCCL 的实际使用建议。

NCCL分布式训练PyTorchGPUInfiniBandAllReduce
2026/7/22 · AI基础设施 · 约 14 分钟

NVIDIA+昇腾双栈Kubernetes调度实战:灰度迁移、流量分割与统一运维

深度讲解NVIDIA GPU与华为昇腾NPU在同一Kubernetes集群中的双栈调度方案:基于标签和污点的精准任务分发、推理服务的蓝绿切换(NVIDIA→昇腾逐步迁移)、Istio流量分割实现A/B测试、统一Prometheus监控(DCGM Exporter + NPU Exporter数据对齐)、双栈集群的运维SOP与故障应急预案。

NVIDIA昇腾Kubernetes双栈调度混合集群灰度迁移IstioAI基础设施
2026/7/22 · AI基础设施 · 约 16 分钟

NVIDIA MIG 多实例 GPU Kubernetes 进阶运维指南

深入讲解 NVIDIA Multi-Instance GPU(MIG)在 Kubernetes 集群中的配置策略、Single/Mixed 模式实战、GPU Operator 自动化管理与多租户隔离最佳实践。

NVIDIAMIGKubernetesGPUGPU Operator多租户
2026/7/22 · AI基础设施 · 约 12 分钟

Ollama 显存优化与模型选型:不同 GPU 配置下的最优方案

根据实测数据给出不同显存配置(8GB/16GB/24GB/48GB/80GB)下的 Ollama 最优模型选型方案,讲解量化精度对质量和速度的影响、KV Cache 优化、多卡分布、以及如何用 CPU Offload 突破单卡显存限制。

Ollama显存优化GPU量化DeepSeekQwen3模型选型
2026/7/22 · AI基础设施 · 约 13 分钟

Ollama 本地大模型部署完全指南:从安装到 API 调用

详细讲解 Ollama 的安装配置、主流模型(DeepSeek/Qwen3/Llama)的下载运行、REST API 和 OpenAI 兼容接口使用,以及多 GPU、自定义 Modelfile、模型量化选择等实用技巧,帮助团队快速搭建私有化 AI 推理服务。

Ollama本地大模型LLMDeepSeekQwen3私有化部署
2026/7/22 · AI基础设施 · 约 14 分钟

Open WebUI + Ollama:搭建企业私有 AI 助手平台

完整讲解如何用 Open WebUI 在 Ollama 之上构建功能完备的私有 AI 平台,包括 Docker 部署、用户管理、多模型切换、文档 RAG、知识库、API Key 管理,以及 Kubernetes 生产级部署方案。

Open WebUIOllama私有AIRAG知识库企业部署
2026/7/22 · AI基础设施 · 约 12 分钟

ROCm 7 vs CUDA 2026 开发者选型指南:差距有多大?

基于 2026 年最新进展,从框架支持、性能对比、开发体验、生态成熟度四个维度全面对比 AMD ROCm 7 与 NVIDIA CUDA,帮助开发者和企业做出合理的 GPU 技术选型决策。

ROCmCUDAAMDNVIDIAGPU开发技术选型
2026/7/22 · AI基础设施 · 约 13 分钟

vLLM 0.21 核心特性深度解析:KV Offload、Prefix Caching 与 Speculative Decoding

深入解析 vLLM 0.21 三大核心新特性:基于 Hybrid Memory Allocator 的 KV Cache CPU Offload、默认开启的 Prefix Caching 工作原理与命中率优化,以及 Reasoning 模型的 Speculative Decoding 支持。

vLLMKV CachePrefix CachingSpeculative DecodingLLM推理
2026/7/22 · AI基础设施 · 约 16 分钟

vLLM on Kubernetes 生产部署与 KEDA 弹性伸缩实战

完整讲解 vLLM 0.21 在 Kubernetes 上的生产级部署方案,包括多 GPU Tensor Parallel 配置、Readiness/Liveness 探针设置、KEDA 基于 Prometheus 队列深度自动弹性伸缩,以及 FP8 精度与 Prefix Caching 生产调优。

vLLMKubernetesKEDAGPULLM推理弹性伸缩
2026/7/22 · AI基础设施 · 约 13 分钟

信创合规下的AI算力选型:昇腾/寒武纪认证体系与采购实战指南

系统讲解信创(国产化替代)场景下AI算力的合规要求与选型决策:信创目录认证流程、央企/政务云GPU采购规范、昇腾和寒武纪的信创认证状态、等保2.0对AI基础设施的要求、信创算力方案的性价比评估,以及如何向上级机构提交信创合规报告。

信创国产化昇腾寒武纪合规采购AI基础设施国产GPU
2026/7/22 · AI基础设施 · 约 13 分钟

信创数据中心GPU运维规范:等保2.0、国密算法与审计日志实战

系统讲解信创AI算力数据中心的运维安全规范:等保2.0三级对GPU集群的具体要求(网络隔离/访问控制/日志审计)、Kubernetes审计日志配置与180天留存、国密算法在容器通信中的应用(SM4替代AES)、GPU节点漏洞扫描与合规基线检查、信创环境下的离线镜像管理,以及年度安全检查清单。

信创等保2.0国密安全运维Kubernetes合规AI基础设施审计
2026/7/21 · AI基础设施 · 8分钟阅读

HAMi vGPU 容量规划:一张 GPU 到底能切给多少个任务?

HAMi 支持在 Kubernetes 中对 GPU 等加速器做虚拟化和共享,本文从容量规划、隔离、监控和风险控制角度给出运维建议。

HAMivGPUKubernetes容量规划
2026/7/21 · AI基础设施 · 8分钟阅读

NVIDIA GPU Operator:GPU 节点运维为什么不建议只靠手工装驱动?

NVIDIA GPU Operator 能自动管理 Kubernetes GPU 节点所需的驱动、Container Toolkit、Device Plugin、DCGM 等组件。本文整理运维落地检查项。

NVIDIA GPU OperatorGPU节点KubernetesCUDA
2026/7/20 · AI基础设施 · 8分钟阅读

GPU 驱动、CUDA 与容器运行时版本矩阵:为什么 AI 节点升级容易翻车?

GPU 节点升级不能只看一个软件版本,驱动、CUDA、容器镜像、NVIDIA Container Toolkit 和 Kubernetes 组件都需要形成版本矩阵。

GPU运维CUDA容器运行时版本管理
2026/7/19 · AI基础设施 · 7分钟阅读

GPU 节点可观测性 SLI/SLO:不要只盯利用率

GPU 利用率只是 AI 基础设施指标的一部分,生产环境还需要关注显存、温度、错误、排队、首 token 时间和任务成功率。

GPU监控SLISLO可观测性