技术博客

聚合 Linux、Windows、Kubernetes、云原生、安全运维和自动化实践,沉淀可检索、可复用的技术文章。

全部文章

共 204 篇文章,当前第 5 / 14 页

2026/7/22 · Linux · 约 13 分钟

Linux ACL 与 sudo 细粒度权限管理实战

在 chmod/chown 之上深入讲解 Linux 扩展访问控制列表(ACL)的配置与排查,以及 sudoers 文件的精细化授权——包括按用户、按命令、按时间窗口的最小权限配置,适用于多人协作的生产服务器。

LinuxACLsudo权限管理安全运维sudoers
2026/7/22 · Linux · 约 14 分钟

Linux cgroup v2 进程资源控制实战:CPU、内存、IO 限速

深入讲解 Linux cgroup v2(统一层级)的资源控制机制,包括 CPU 配额与权重、内存限制与 OOM 策略、IO 限速,以及如何用 systemd 单元文件和 cgroupfs 接口在生产环境中实现进程级资源隔离。

cgroupLinux资源限制CPU内存性能调优systemd
2026/7/22 · Linux · 约 15 分钟

Linux LVM 逻辑卷管理实战:扩容、快照、迁移全流程

深入讲解 LVM(逻辑卷管理器)的核心概念与生产操作:PV/VG/LV 的创建与管理、在线扩容不停机、LVM 快照备份、瘦配置(Thin Provisioning)、以及跨磁盘数据迁移的完整操作流程。

LVMLinux存储扩容快照磁盘管理
2026/7/22 · Linux · 约 14 分钟

Linux 性能分析三件套:perf、火焰图、strace 实战

系统讲解 Linux 性能分析的三个核心工具:perf 采样 CPU 热点、FlameGraph 可视化调用栈、strace/ltrace 追踪系统调用,通过真实案例演示如何定位 CPU 飙升、进程卡死、系统调用异常等生产级性能问题。

perf火焰图straceLinux性能分析故障排查
2026/7/22 · Linux · 约 15 分钟

Linux 系统急救:rescue mode、GRUB 修复、fsck 完整操作手册

详解 Linux 系统无法启动时的完整急救流程:GRUB 故障修复、rescue/emergency 模式进入、root 密码重置、文件系统损坏 fsck 修复、关键系统文件恢复,覆盖 Ubuntu/CentOS/RHEL 常见场景。

Linux系统恢复GRUBfsckrescue故障排查运维急救
2026/7/22 · Linux · 约 13 分钟

Linux sysctl 内核参数调优:Web 服务器与数据库生产配置

系统讲解 Linux sysctl 内核参数的分类与调优方法,提供 Web 服务器(高并发)和数据库服务器的生产级参数配置,覆盖网络栈优化、内存管理、文件句柄、TCP 调优等核心参数,含完整的 sysctl.conf 配置模板。

sysctlLinux内核调优性能优化TCP网络生产配置
2026/7/22 · AI基础设施 · 约 14 分钟

LLM 推理引擎横评:vLLM vs SGLang vs TensorRT-LLM 选型指南(2026)

从吞吐量、延迟、显存效率、部署复杂度、功能特性四个维度全面对比三大主流 LLM 推理引擎,帮助运维和算法团队根据实际场景做出选型决策,覆盖在线 API、批处理、Reasoning 模型等典型场景。

vLLMSGLangTensorRT-LLMLLM推理推理引擎性能优化
2026/7/22 · 监控告警 · 约 14 分钟

Loki 日志聚合实战:Promtail 采集、LogQL 查询与生产部署

系统讲解 Grafana Loki 日志系统的生产部署:Loki 架构与存储原理(标签索引 vs 全文索引)、Promtail 多场景日志采集配置(Kubernetes/文件/系统日志)、LogQL 查询语言从基础到进阶、Loki 日志告警配置、Loki 分布式部署与存储配置(S3/阿里云 OSS 后端)。

Loki日志LogQLPromtail可观测性监控Grafana
2026/7/22 · AI基础设施 · 约 12 分钟

摩尔线程MTT GPU运维实战:MUSA环境配置与Kubernetes集成

详解摩尔线程MTT S80/S4000 GPU的运维配置:MUSA SDK安装与环境配置、mthreads-gmi监控工具使用、PyTorch MUSA适配安装、Kubernetes Device Plugin部署、vLLM推理引擎在MUSA上的部署方法,以及常见兼容性问题的排查解决。

摩尔线程Moore ThreadsMUSA国产GPUKubernetesAI推理AI基础设施
2026/7/22 · AI基础设施 · 约 14 分钟

NCCL 多 GPU 通信原理与分布式训练调优实践

深入讲解 NCCL(NVIDIA Collective Communications Library)的核心通信原语、AllReduce/AllGather 算法选择、多节点 InfiniBand 配置与性能调优,以及 PyTorch FSDP 和 DeepSpeed ZeRO 中 NCCL 的实际使用建议。

NCCL分布式训练PyTorchGPUInfiniBandAllReduce
2026/7/22 · AI基础设施 · 约 14 分钟

NVIDIA+昇腾双栈Kubernetes调度实战:灰度迁移、流量分割与统一运维

深度讲解NVIDIA GPU与华为昇腾NPU在同一Kubernetes集群中的双栈调度方案:基于标签和污点的精准任务分发、推理服务的蓝绿切换(NVIDIA→昇腾逐步迁移)、Istio流量分割实现A/B测试、统一Prometheus监控(DCGM Exporter + NPU Exporter数据对齐)、双栈集群的运维SOP与故障应急预案。

NVIDIA昇腾Kubernetes双栈调度混合集群灰度迁移IstioAI基础设施
2026/7/22 · AI基础设施 · 约 16 分钟

NVIDIA MIG 多实例 GPU Kubernetes 进阶运维指南

深入讲解 NVIDIA Multi-Instance GPU(MIG)在 Kubernetes 集群中的配置策略、Single/Mixed 模式实战、GPU Operator 自动化管理与多租户隔离最佳实践。

NVIDIAMIGKubernetesGPUGPU Operator多租户
2026/7/22 · AI基础设施 · 约 12 分钟

Ollama 显存优化与模型选型:不同 GPU 配置下的最优方案

根据实测数据给出不同显存配置(8GB/16GB/24GB/48GB/80GB)下的 Ollama 最优模型选型方案,讲解量化精度对质量和速度的影响、KV Cache 优化、多卡分布、以及如何用 CPU Offload 突破单卡显存限制。

Ollama显存优化GPU量化DeepSeekQwen3模型选型
2026/7/22 · AI基础设施 · 约 13 分钟

Ollama 本地大模型部署完全指南:从安装到 API 调用

详细讲解 Ollama 的安装配置、主流模型(DeepSeek/Qwen3/Llama)的下载运行、REST API 和 OpenAI 兼容接口使用,以及多 GPU、自定义 Modelfile、模型量化选择等实用技巧,帮助团队快速搭建私有化 AI 推理服务。

Ollama本地大模型LLMDeepSeekQwen3私有化部署
2026/7/22 · AI基础设施 · 约 14 分钟

Open WebUI + Ollama:搭建企业私有 AI 助手平台

完整讲解如何用 Open WebUI 在 Ollama 之上构建功能完备的私有 AI 平台,包括 Docker 部署、用户管理、多模型切换、文档 RAG、知识库、API Key 管理,以及 Kubernetes 生产级部署方案。

Open WebUIOllama私有AIRAG知识库企业部署