技术博客

聚合 Linux、Windows、Kubernetes、云原生、安全运维和自动化实践,沉淀可检索、可复用的技术文章。

全部文章

共 241 篇文章,当前第 6 / 17 页

2026/7/22 · Linux · 约 15 分钟

Linux 系统急救:rescue mode、GRUB 修复、fsck 完整操作手册

详解 Linux 系统无法启动时的完整急救流程:GRUB 故障修复、rescue/emergency 模式进入、root 密码重置、文件系统损坏 fsck 修复、关键系统文件恢复,覆盖 Ubuntu/CentOS/RHEL 常见场景。

Linux系统恢复GRUBfsckrescue故障排查运维急救
2026/7/22 · Linux · 约 13 分钟

Linux sysctl 内核参数调优:Web 服务器与数据库生产配置

系统讲解 Linux sysctl 内核参数的分类与调优方法,提供 Web 服务器(高并发)和数据库服务器的生产级参数配置,覆盖网络栈优化、内存管理、文件句柄、TCP 调优等核心参数,含完整的 sysctl.conf 配置模板。

sysctlLinux内核调优性能优化TCP网络生产配置
2026/7/22 · AI基础设施 · 约 14 分钟

LLM 推理引擎横评:vLLM vs SGLang vs TensorRT-LLM 选型指南(2026)

从吞吐量、延迟、显存效率、部署复杂度、功能特性四个维度全面对比三大主流 LLM 推理引擎,帮助运维和算法团队根据实际场景做出选型决策,覆盖在线 API、批处理、Reasoning 模型等典型场景。

vLLMSGLangTensorRT-LLMLLM推理推理引擎性能优化
2026/7/22 · 监控告警 · 约 14 分钟

Loki 日志聚合实战:Promtail 采集、LogQL 查询与生产部署

系统讲解 Grafana Loki 日志系统的生产部署:Loki 架构与存储原理(标签索引 vs 全文索引)、Promtail 多场景日志采集配置(Kubernetes/文件/系统日志)、LogQL 查询语言从基础到进阶、Loki 日志告警配置、Loki 分布式部署与存储配置(S3/阿里云 OSS 后端)。

Loki日志LogQLPromtail可观测性监控Grafana
2026/7/22 · AI基础设施 · 约 12 分钟

摩尔线程MTT GPU运维实战:MUSA环境配置与Kubernetes集成

详解摩尔线程MTT S80/S4000 GPU的运维配置:MUSA SDK安装与环境配置、mthreads-gmi监控工具使用、PyTorch MUSA适配安装、Kubernetes Device Plugin部署、vLLM推理引擎在MUSA上的部署方法,以及常见兼容性问题的排查解决。

摩尔线程Moore ThreadsMUSA国产GPUKubernetesAI推理AI基础设施
2026/7/22 · AI基础设施 · 约 14 分钟

NCCL 多 GPU 通信原理与分布式训练调优实践

深入讲解 NCCL(NVIDIA Collective Communications Library)的核心通信原语、AllReduce/AllGather 算法选择、多节点 InfiniBand 配置与性能调优,以及 PyTorch FSDP 和 DeepSpeed ZeRO 中 NCCL 的实际使用建议。

NCCL分布式训练PyTorchGPUInfiniBandAllReduce
2026/7/22 · AI基础设施 · 约 14 分钟

NVIDIA+昇腾双栈Kubernetes调度实战:灰度迁移、流量分割与统一运维

深度讲解NVIDIA GPU与华为昇腾NPU在同一Kubernetes集群中的双栈调度方案:基于标签和污点的精准任务分发、推理服务的蓝绿切换(NVIDIA→昇腾逐步迁移)、Istio流量分割实现A/B测试、统一Prometheus监控(DCGM Exporter + NPU Exporter数据对齐)、双栈集群的运维SOP与故障应急预案。

NVIDIA昇腾Kubernetes双栈调度混合集群灰度迁移IstioAI基础设施
2026/7/22 · AI基础设施 · 约 16 分钟

NVIDIA MIG 多实例 GPU Kubernetes 进阶运维指南

深入讲解 NVIDIA Multi-Instance GPU(MIG)在 Kubernetes 集群中的配置策略、Single/Mixed 模式实战、GPU Operator 自动化管理与多租户隔离最佳实践。

NVIDIAMIGKubernetesGPUGPU Operator多租户
2026/7/22 · AI基础设施 · 约 12 分钟

Ollama 显存优化与模型选型:不同 GPU 配置下的最优方案

根据实测数据给出不同显存配置(8GB/16GB/24GB/48GB/80GB)下的 Ollama 最优模型选型方案,讲解量化精度对质量和速度的影响、KV Cache 优化、多卡分布、以及如何用 CPU Offload 突破单卡显存限制。

Ollama显存优化GPU量化DeepSeekQwen3模型选型
2026/7/22 · AI基础设施 · 约 13 分钟

Ollama 本地大模型部署完全指南:从安装到 API 调用

详细讲解 Ollama 的安装配置、主流模型(DeepSeek/Qwen3/Llama)的下载运行、REST API 和 OpenAI 兼容接口使用,以及多 GPU、自定义 Modelfile、模型量化选择等实用技巧,帮助团队快速搭建私有化 AI 推理服务。

Ollama本地大模型LLMDeepSeekQwen3私有化部署
2026/7/22 · AI基础设施 · 约 14 分钟

Open WebUI + Ollama:搭建企业私有 AI 助手平台

完整讲解如何用 Open WebUI 在 Ollama 之上构建功能完备的私有 AI 平台,包括 Docker 部署、用户管理、多模型切换、文档 RAG、知识库、API Key 管理,以及 Kubernetes 生产级部署方案。

Open WebUIOllama私有AIRAG知识库企业部署
2026/7/22 · 监控告警 · 约 14 分钟

OpenTelemetry 分布式追踪实战:Jaeger 部署、链路分析与性能调优

系统讲解分布式追踪的原理与实战:OpenTelemetry SDK 埋点(Go/Java/Python)、Jaeger 分布式追踪系统部署与配置、Trace/Span/Context 核心概念、W3C TraceContext 传播标准、采样策略配置(尾部采样/概率采样)、通过 Jaeger UI 分析慢请求和依赖关系图,以及 OTEL Collector 收集转发配置。

OpenTelemetryJaeger分布式追踪可观测性OTEL链路追踪
2026/7/22 · 监控告警 · 约 13 分钟

Alertmanager 实战:告警路由、分组、静默与 PagerDuty/钉钉集成

深入讲解 Prometheus Alertmanager 的核心能力:路由树(route tree)将不同告警分发到不同接收者、告警分组(grouping)合并同类告警减少噪音、静默(silence)和抑制(inhibition)规则、与钉钉/飞书/PagerDuty 集成,以及告警升级策略的完整生产配置。

AlertmanagerPrometheus告警监控钉钉运维
2026/7/22 · 监控告警 · 约 14 分钟

Prometheus 大规模优化:Recording Rules、Federation 与 Thanos 长期存储

系统讲解 Prometheus 大规模生产优化方案:Recording Rules 预计算高频 PromQL 提升查询性能、Federation 联邦架构跨集群聚合、Thanos 组件(Sidecar/Store/Query/Compactor)实现无限长期存储与全局查询、Prometheus 内存和存储调优参数配置。

PrometheusThanosRecording Rules可观测性监控性能优化运维
2026/7/22 · 超融合 · 约 15 分钟

Proxmox + Ceph 超融合生产实战:OSD 规划、网络隔离、性能调优

深入讲解 Proxmox VE + Ceph 超融合基础设施的生产级部署:OSD 设备规划与 BlueStore 配置、集群网络与公共网络分离、CRUSH Map 数据分布策略、Pool 与 RBD 性能调优、常见故障恢复(OSD 宕机/PG 不健康/磁盘故障替换),覆盖 3 节点到 5 节点的真实企业场景。

ProxmoxCeph超融合存储HCIOSDCRUSH生产运维