技术博客
聚合 Linux、Windows、Kubernetes、云原生、安全运维和自动化实践,沉淀可检索、可复用的技术文章。
事件驱动自动化:Ansible 不只是批量执行命令
事件驱动自动化把监控告警、规则判断和自动处置连接起来,适合告警降噪、标准化恢复和运维流程提效。
Gateway API 会替代 Ingress 吗?云原生入口网关升级思路
Gateway API 正在成为 Kubernetes 入口流量治理的重要方向,本文从角色分工、路由能力和迁移策略解释它和 Ingress 的关系。
Nutanix AHV 与超融合架构:为什么 HCI 强调一体化运维?
Nutanix AHV 是超融合平台中的常见虚拟化选择,HCI 的重点是把计算、存储、虚拟化和管理体验整合起来。
OpenStack 和 Proxmox 怎么选?中小私有云别只看功能表
OpenStack 和 Proxmox 都能建设私有云/虚拟化平台,但复杂度、团队能力、自动化和规模目标完全不同。
docker-compose 进阶:profiles 多环境、override 文件、扩缩容与健康联动
深入讲解 docker-compose 的进阶用法:profiles 实现开发/测试/生产环境按需启动服务、compose override 文件分层覆盖配置、docker compose scale 水平扩容配合 Nginx 负载均衡、extend 复用服务定义、watch 模式实现代码热更新,以及 compose 项目的目录组织最佳实践。
GitLab CI Cache 和 Artifacts 有什么区别?流水线提速别用错
Cache 用于复用依赖和中间缓存,Artifacts 用于传递构建结果。理解两者区别,可以让 CI/CD 更快也更可靠。
超融合节点维护窗口怎么安排?升级重启前的检查清单
超融合节点维护会同时影响计算和存储,维护前必须检查虚拟机迁移、存储健康、备份任务和容量水位。
三节点超融合集群安全吗?小规模 HCI 的风险边界
三节点超融合是常见入门形态,但在维护、扩容、节点故障和容量水位方面有明显风险边界。
Terraform State 为什么要加锁?基础设施自动化的隐形风险
Terraform state 是基础设施真实状态的重要记录,团队协作时必须关注远程后端、状态锁、权限和备份。
超融合容量规划:CPU、内存和存储为什么不能分开算
超融合节点同时承载计算和存储,容量规划要综合 CPU、内存、裸容量、副本、恢复空间和增长速度。
超融合平台监控指标:别只看虚拟机 CPU 和内存
超融合监控要覆盖计算、存储、网络、虚拟机、备份和集群健康,单看 VM 指标远远不够。
网络故障排查:mtr、tcpdump 和 ss 应该怎么组合使用?
网络问题不能只 ping,一线运维需要把路径质量、端口状态、连接队列和抓包证据结合起来判断。
Prometheus 告警疲劳怎么治理?从标签和分组开始
告警太多不是监控成熟,而是信号质量差。Prometheus 告警治理要从标签、分组、抑制和 Runbook 做起。
DNS 故障排查:dig、resolvectl 和 systemd-resolved 怎么看?
DNS 问题会表现为应用超时、访问慢和证书异常,本文梳理 Linux 服务器上 DNS 排查的常用命令和思路。
Linux Load 很高但 CPU 不高,问题可能在哪里?
Load Average 不等于 CPU 使用率。磁盘 IO、不可中断睡眠、进程排队和系统调用阻塞都可能导致 Load 升高。
