技术博客

聚合 Linux、Windows、Kubernetes、云原生、安全运维和自动化实践,沉淀可检索、可复用的技术文章。

全部文章

共 204 篇文章,当前第 6 / 14 页

2026/7/22 · 监控告警 · 约 14 分钟

OpenTelemetry 分布式追踪实战:Jaeger 部署、链路分析与性能调优

系统讲解分布式追踪的原理与实战:OpenTelemetry SDK 埋点(Go/Java/Python)、Jaeger 分布式追踪系统部署与配置、Trace/Span/Context 核心概念、W3C TraceContext 传播标准、采样策略配置(尾部采样/概率采样)、通过 Jaeger UI 分析慢请求和依赖关系图,以及 OTEL Collector 收集转发配置。

OpenTelemetryJaeger分布式追踪可观测性OTEL链路追踪
2026/7/22 · 监控告警 · 约 13 分钟

Alertmanager 实战:告警路由、分组、静默与 PagerDuty/钉钉集成

深入讲解 Prometheus Alertmanager 的核心能力:路由树(route tree)将不同告警分发到不同接收者、告警分组(grouping)合并同类告警减少噪音、静默(silence)和抑制(inhibition)规则、与钉钉/飞书/PagerDuty 集成,以及告警升级策略的完整生产配置。

AlertmanagerPrometheus告警监控钉钉运维
2026/7/22 · 监控告警 · 约 14 分钟

Prometheus 大规模优化:Recording Rules、Federation 与 Thanos 长期存储

系统讲解 Prometheus 大规模生产优化方案:Recording Rules 预计算高频 PromQL 提升查询性能、Federation 联邦架构跨集群聚合、Thanos 组件(Sidecar/Store/Query/Compactor)实现无限长期存储与全局查询、Prometheus 内存和存储调优参数配置。

PrometheusThanosRecording Rules可观测性监控性能优化运维
2026/7/22 · 超融合 · 约 15 分钟

Proxmox + Ceph 超融合生产实战:OSD 规划、网络隔离、性能调优

深入讲解 Proxmox VE + Ceph 超融合基础设施的生产级部署:OSD 设备规划与 BlueStore 配置、集群网络与公共网络分离、CRUSH Map 数据分布策略、Pool 与 RBD 性能调优、常见故障恢复(OSD 宕机/PG 不健康/磁盘故障替换),覆盖 3 节点到 5 节点的真实企业场景。

ProxmoxCeph超融合存储HCIOSDCRUSH生产运维
2026/7/22 · 虚拟化 · 约 14 分钟

Proxmox VE 高可用集群:HA Manager、节点 Fencing、VIP 漂移实战

详解 Proxmox VE 高可用集群的构建与运维:Corosync 集群通信配置、HA Manager 自动故障转移原理、节点 Fencing(STONITH)防止脑裂、LVM-thin/Ceph 共享存储集成、HA 资源配置与优先级管理,覆盖节点宕机时的自动恢复流程。

ProxmoxHA高可用CorosyncFencing集群虚拟化
2026/7/22 · AI基础设施 · 约 12 分钟

ROCm 7 vs CUDA 2026 开发者选型指南:差距有多大?

基于 2026 年最新进展,从框架支持、性能对比、开发体验、生态成熟度四个维度全面对比 AMD ROCm 7 与 NVIDIA CUDA,帮助开发者和企业做出合理的 GPU 技术选型决策。

ROCmCUDAAMDNVIDIAGPU开发技术选型
2026/7/22 · 超融合 · 7分钟阅读

2026 虚拟化与超融合学习路线:从 KVM 到 HCI 运维

虚拟化与超融合不是只会创建虚拟机,运维人员还要理解计算、存储、网络、HA、备份和容量规划。

虚拟化超融合KVM学习路线
2026/7/22 · 虚拟化 · 约 14 分钟

虚拟化 NUMA 深度调优:CPU Pin、大页内存、内存绑定实战

深入讲解虚拟化平台的 NUMA(非统一内存访问)调优技术:NUMA 拓扑感知、vCPU 绑定到物理 CPU(CPU Pinning)、大页内存(Huge Pages)消除 TLB 压力、NUMA 内存绑定防止跨 NUMA 访问,通过低延迟数据库和高性能计算场景的完整配置,掌握虚拟机极致性能调优。

KVMNUMACPU-Pinning大页内存性能调优虚拟化HugePages
2026/7/22 · AI基础设施 · 约 13 分钟

vLLM 0.21 核心特性深度解析:KV Offload、Prefix Caching 与 Speculative Decoding

深入解析 vLLM 0.21 三大核心新特性:基于 Hybrid Memory Allocator 的 KV Cache CPU Offload、默认开启的 Prefix Caching 工作原理与命中率优化,以及 Reasoning 模型的 Speculative Decoding 支持。

vLLMKV CachePrefix CachingSpeculative DecodingLLM推理
2026/7/22 · AI基础设施 · 约 16 分钟

vLLM on Kubernetes 生产部署与 KEDA 弹性伸缩实战

完整讲解 vLLM 0.21 在 Kubernetes 上的生产级部署方案,包括多 GPU Tensor Parallel 配置、Readiness/Liveness 探针设置、KEDA 基于 Prometheus 队列深度自动弹性伸缩,以及 FP8 精度与 Prefix Caching 生产调优。

vLLMKubernetesKEDAGPULLM推理弹性伸缩
2026/7/22 · AI基础设施 · 约 13 分钟

信创合规下的AI算力选型:昇腾/寒武纪认证体系与采购实战指南

系统讲解信创(国产化替代)场景下AI算力的合规要求与选型决策:信创目录认证流程、央企/政务云GPU采购规范、昇腾和寒武纪的信创认证状态、等保2.0对AI基础设施的要求、信创算力方案的性价比评估,以及如何向上级机构提交信创合规报告。

信创国产化昇腾寒武纪合规采购AI基础设施国产GPU
2026/7/22 · AI基础设施 · 约 13 分钟

信创数据中心GPU运维规范:等保2.0、国密算法与审计日志实战

系统讲解信创AI算力数据中心的运维安全规范:等保2.0三级对GPU集群的具体要求(网络隔离/访问控制/日志审计)、Kubernetes审计日志配置与180天留存、国密算法在容器通信中的应用(SM4替代AES)、GPU节点漏洞扫描与合规基线检查、信创环境下的离线镜像管理,以及年度安全检查清单。

信创等保2.0国密安全运维Kubernetes合规AI基础设施审计
2026/7/21 · 自动化运维 · 8分钟阅读

Ansible 维护周期变化下,Playbook 升级前如何做兼容性检查

结合 ansible-core 2.19 到 2.21 的维护信息,整理自动化运维中 Python 版本、模板行为、连接插件和 playbook 校验的升级清单。

AnsiblePlaybook自动化运维Python
2026/7/21 · 云原生 · 8分钟阅读

containerd 2.3 LTS 对 Kubernetes 运维意味着什么

containerd 2.3 已进入 LTS 维护周期,本文解释 Kubernetes 节点运行时升级时需要关注的版本支持、CRI、runc、CNI 和回滚策略。

containerdKubernetesCRI容器运行时
2026/7/21 · 安全运维 · 8分钟阅读

Microsoft Defender for Endpoint:Windows 终端安全运维要关注哪些能力

Microsoft Defender for Endpoint 在 Windows 上提供下一代防护、EDR、自动调查响应和安全基线评估。本文整理运维落地重点。

Defender for EndpointEDRWindows安全ASR