技术博客
聚合 Linux、Windows、Kubernetes、云原生、安全运维和自动化实践,沉淀可检索、可复用的技术文章。
Linux 系统急救:rescue mode、GRUB 修复、fsck 完整操作手册
详解 Linux 系统无法启动时的完整急救流程:GRUB 故障修复、rescue/emergency 模式进入、root 密码重置、文件系统损坏 fsck 修复、关键系统文件恢复,覆盖 Ubuntu/CentOS/RHEL 常见场景。
Linux sysctl 内核参数调优:Web 服务器与数据库生产配置
系统讲解 Linux sysctl 内核参数的分类与调优方法,提供 Web 服务器(高并发)和数据库服务器的生产级参数配置,覆盖网络栈优化、内存管理、文件句柄、TCP 调优等核心参数,含完整的 sysctl.conf 配置模板。
LLM 推理引擎横评:vLLM vs SGLang vs TensorRT-LLM 选型指南(2026)
从吞吐量、延迟、显存效率、部署复杂度、功能特性四个维度全面对比三大主流 LLM 推理引擎,帮助运维和算法团队根据实际场景做出选型决策,覆盖在线 API、批处理、Reasoning 模型等典型场景。
Loki 日志聚合实战:Promtail 采集、LogQL 查询与生产部署
系统讲解 Grafana Loki 日志系统的生产部署:Loki 架构与存储原理(标签索引 vs 全文索引)、Promtail 多场景日志采集配置(Kubernetes/文件/系统日志)、LogQL 查询语言从基础到进阶、Loki 日志告警配置、Loki 分布式部署与存储配置(S3/阿里云 OSS 后端)。
摩尔线程MTT GPU运维实战:MUSA环境配置与Kubernetes集成
详解摩尔线程MTT S80/S4000 GPU的运维配置:MUSA SDK安装与环境配置、mthreads-gmi监控工具使用、PyTorch MUSA适配安装、Kubernetes Device Plugin部署、vLLM推理引擎在MUSA上的部署方法,以及常见兼容性问题的排查解决。
NCCL 多 GPU 通信原理与分布式训练调优实践
深入讲解 NCCL(NVIDIA Collective Communications Library)的核心通信原语、AllReduce/AllGather 算法选择、多节点 InfiniBand 配置与性能调优,以及 PyTorch FSDP 和 DeepSpeed ZeRO 中 NCCL 的实际使用建议。
NVIDIA+昇腾双栈Kubernetes调度实战:灰度迁移、流量分割与统一运维
深度讲解NVIDIA GPU与华为昇腾NPU在同一Kubernetes集群中的双栈调度方案:基于标签和污点的精准任务分发、推理服务的蓝绿切换(NVIDIA→昇腾逐步迁移)、Istio流量分割实现A/B测试、统一Prometheus监控(DCGM Exporter + NPU Exporter数据对齐)、双栈集群的运维SOP与故障应急预案。
NVIDIA MIG 多实例 GPU Kubernetes 进阶运维指南
深入讲解 NVIDIA Multi-Instance GPU(MIG)在 Kubernetes 集群中的配置策略、Single/Mixed 模式实战、GPU Operator 自动化管理与多租户隔离最佳实践。
Ollama 显存优化与模型选型:不同 GPU 配置下的最优方案
根据实测数据给出不同显存配置(8GB/16GB/24GB/48GB/80GB)下的 Ollama 最优模型选型方案,讲解量化精度对质量和速度的影响、KV Cache 优化、多卡分布、以及如何用 CPU Offload 突破单卡显存限制。
Ollama 本地大模型部署完全指南:从安装到 API 调用
详细讲解 Ollama 的安装配置、主流模型(DeepSeek/Qwen3/Llama)的下载运行、REST API 和 OpenAI 兼容接口使用,以及多 GPU、自定义 Modelfile、模型量化选择等实用技巧,帮助团队快速搭建私有化 AI 推理服务。
Open WebUI + Ollama:搭建企业私有 AI 助手平台
完整讲解如何用 Open WebUI 在 Ollama 之上构建功能完备的私有 AI 平台,包括 Docker 部署、用户管理、多模型切换、文档 RAG、知识库、API Key 管理,以及 Kubernetes 生产级部署方案。
OpenTelemetry 分布式追踪实战:Jaeger 部署、链路分析与性能调优
系统讲解分布式追踪的原理与实战:OpenTelemetry SDK 埋点(Go/Java/Python)、Jaeger 分布式追踪系统部署与配置、Trace/Span/Context 核心概念、W3C TraceContext 传播标准、采样策略配置(尾部采样/概率采样)、通过 Jaeger UI 分析慢请求和依赖关系图,以及 OTEL Collector 收集转发配置。
Alertmanager 实战:告警路由、分组、静默与 PagerDuty/钉钉集成
深入讲解 Prometheus Alertmanager 的核心能力:路由树(route tree)将不同告警分发到不同接收者、告警分组(grouping)合并同类告警减少噪音、静默(silence)和抑制(inhibition)规则、与钉钉/飞书/PagerDuty 集成,以及告警升级策略的完整生产配置。
Prometheus 大规模优化:Recording Rules、Federation 与 Thanos 长期存储
系统讲解 Prometheus 大规模生产优化方案:Recording Rules 预计算高频 PromQL 提升查询性能、Federation 联邦架构跨集群聚合、Thanos 组件(Sidecar/Store/Query/Compactor)实现无限长期存储与全局查询、Prometheus 内存和存储调优参数配置。
Proxmox + Ceph 超融合生产实战:OSD 规划、网络隔离、性能调优
深入讲解 Proxmox VE + Ceph 超融合基础设施的生产级部署:OSD 设备规划与 BlueStore 配置、集群网络与公共网络分离、CRUSH Map 数据分布策略、Pool 与 RBD 性能调优、常见故障恢复(OSD 宕机/PG 不健康/磁盘故障替换),覆盖 3 节点到 5 节点的真实企业场景。
