技术博客

聚合 Linux、Windows、Kubernetes、云原生、安全运维和自动化实践,沉淀可检索、可复用的技术文章。

全部文章

共 233 篇文章,当前第 2 / 16 页

2026/7/22 · AI基础设施 · 约 13 分钟

CUDA迁移到海光DCU实战:HIP编程模型、hipify工具与常见坑

系统讲解从NVIDIA CUDA迁移到海光DCU(ROCm/HIP)的完整实战流程:hipify-perl自动转换工具使用、HIP与CUDA API对照表、PyTorch/DeepSpeed DCU适配方法、分布式训练NCCL→RCCL迁移、迁移后性能调优(rocprof/rocblas调参),以及迁移难度评估方法论。

海光DCUCUDAHIPROCm迁移AI基础设施国产GPU
2026/7/22 · AI基础设施 · 约 12 分钟

国产GPU 2025技术现状与运维挑战:910C、DCU3路线图与选型建议

深度分析2025-2026年国产GPU技术发展现状:华为昇腾910C规格与量产进展、海光DCU3(Z200系列)路线图、国产GPU与NVIDIA H100/H200的性能差距客观评估、AI算力国产化的现实挑战(算子、互联、软件生态),以及运维团队的实际应对建议。

国产GPU昇腾910C海光DCU华为AI基础设施信创国产化算力
2026/7/22 · AI基础设施 · 约 14 分钟

国产GPU全景选型指南:昇腾/海光DCU/摩尔线程/寒武纪技术对比与生产选型

深度对比主流国产GPU厂商的技术路线与运维成熟度:华为昇腾910B/910C(CANN生态)、海光DCU(ROCm生态,CUDA迁移成本最低)、摩尔线程MTT S4000(MUSA架构)、寒武纪MLU370,从驱动生态、Kubernetes集成、软件兼容性、性能基准等维度给出选型决策建议。

国产GPU昇腾海光DCU摩尔线程寒武纪选型AI基础设施信创
2026/7/22 · AI基础设施 · 约 13 分钟

国产GPU软件生态深度分析:CANN vs ROCm vs MUSA与CUDA的真实差距

客观分析2025年国产GPU软件生态的真实状态:CANN(昇腾)、ROCm/HIP(海光DCU)、MUSA(摩尔线程)三大生态与CUDA生态的深度对比,包括算子覆盖率、主流框架支持度、开发者工具链完整性、社区活跃度,以及对运维工程师的实际影响和应对建议。

国产GPUCANNROCmMUSACUDA生态分析AI基础设施软件栈
2026/7/22 · 云原生 · 约 12 分钟

eBPF 是什么:从零理解 Linux 内核可编程化

通俗讲解 eBPF 的核心原理、与传统内核模块的区别、安全验证机制,以及 eBPF 在网络观测、安全策略、性能追踪三大场景的实际应用,帮助运维工程师建立正确的 eBPF 认知框架。

eBPFLinux内核网络可观测性
2026/7/22 · AI基础设施 · 约 14 分钟

FP8/FP4 量化生产推理实战:TensorRT ModelOpt 完全指南

深入讲解 NVIDIA TensorRT ModelOpt 的 FP8 与 FP4 量化原理、校准数据准备、生产导出流程,以及在 H100/H200/B200 上的性能提升数据,覆盖 Qwen3、Llama4 等主流模型的量化实践。

FP8FP4量化TensorRTModelOptLLM推理优化
2026/7/22 · 自动化运维 · 约 12 分钟

GitOps 是什么:从概念到 ArgoCD 快速入门

通俗讲解 GitOps 的核心理念、与传统 CI/CD 的区别,以及如何用 ArgoCD 在 Kubernetes 上实现声明式持续交付——从安装到第一个 Application 上线,含完整命令和配置示例。

GitOpsArgoCDKubernetesCI/CD持续交付DevOps
2026/7/22 · 故障排查 · 约 13 分钟

GPU 节点故障自愈:Node Problem Detector 与自动隔离实战

详解如何在 Kubernetes GPU 集群中通过 Node Problem Detector(NPD)检测 GPU 故障、上报 NodeCondition、结合 Node Auto Remediation 实现节点自动隔离与修复,涵盖 NVIDIA XID 错误、ECC 故障、驱动崩溃等常见场景。

GPUKubernetesNPD故障自愈NVIDIA监控告警
2026/7/22 · AI基础设施 · 约 12 分钟

GPUStack 异构 GPU 集群管理实战:统一调度 NVIDIA/AMD/昇腾

介绍开源 GPU 集群管理器 GPUStack 的架构与核心功能,详解在混合 NVIDIA、AMD ROCm、华为昇腾 GPU 环境下统一部署 LLM 推理服务,以及显存感知调度、多节点推理与 OpenAI 兼容 API 实践。

GPUStack异构GPUNVIDIAAMD昇腾LLM调度
2026/7/22 · 监控告警 · 约 13 分钟

Grafana Dashboard 设计最佳实践:变量、告警、Dashboard as Code

系统讲解 Grafana Dashboard 的专业设计方法:模板变量(Template Variables)实现动态下钻、Panel 类型选择与 PromQL 实战(时序图/Stat/Gauge/Heatmap)、Dashboard 告警配置、使用 Grafonnet 和 Terraform 实现 Dashboard as Code、Grafana 数据源代理与权限管理的生产配置。

GrafanaDashboard监控PromQL可视化运维
2026/7/22 · AI基础设施 · 9分钟阅读

HAMi 是什么?Kubernetes GPU 共享运维要关注哪些问题?

HAMi 已成为 CNCF Incubating 项目,面向 Kubernetes 提供 GPU 和异构加速器虚拟化能力。本文解释它解决的问题、核心组件和运维检查点。

HAMiGPU共享KubernetesCNCF
2026/7/22 · 数通 · 9分钟阅读

ACL 访问控制实验:为什么匹配顺序比规则本身更重要?

从基础 ACL 和高级 ACL 入手,讲清楚流量匹配、规则顺序、接口方向和验证方法。

ACL访问控制网络安全HCIA-Datacom
2026/7/22 · 数通 · 8分钟阅读

DHCP 实验:地址池、网关、DNS 和中继配置怎么排查?

从 DHCP 服务器和 DHCP Relay 两类场景出发,整理地址自动分配实验的关键配置与验证命令。

DHCPDHCP Relay地址分配HCIA-Datacom
2026/7/22 · 数通 · 8分钟阅读

Eth-Trunk 链路聚合实验:带宽提升和链路冗余怎么验证?

从手工聚合和 LACP 思路出发,讲清楚 Eth-Trunk 的接口加入、负载分担和故障验证方法。

Eth-TrunkLACP链路聚合交换网络
2026/7/22 · 数通 · 9分钟阅读

VLAN 间路由实验:二层隔离之后,三层互通应该怎么做?

通过 Vlanif 三层网关实验,理解不同 VLAN 主机互通的前提、网关配置和排查路径。

VLAN间路由Vlanif三层交换HCIA-Datacom